
Francisco Rhaiel
AI Growth Engineer
Data
Apache Airflow para analistas de datos: qué es, cuándo tiene sentido aprenderlo y cómo se diferencia de dbt y Spark
Publicado el
Apache Airflow aparece cada vez más en las ofertas de trabajo de datos, y muchos analistas lo ven sin saber si realmente lo necesitan. La respuesta corta: depende de tu rol. Esta guía desmitifica la herramienta, explica qué hace, cuándo es territorio de data engineers y cuándo de analistas, y en qué se diferencia de dbt y Spark, con un hello world en Python para que veas cómo se ve por dentro.
El problema no es Airflow en sí, sino la confusión sobre para qué sirve. Se lo suele mezclar con dbt y Spark como si compitieran, cuando en realidad resuelven cosas distintas. Entender esa diferencia te ahorra semanas de estudiar algo que quizás no necesitás todavía.
Qué es Apache Airflow
Airflow es una herramienta de orquestación de pipelines. Su trabajo es coordinar tareas: decidir qué se ejecuta, en qué orden, cuándo y qué hacer si algo falla. No procesa datos por sí mismo ni los transforma; dirige el flujo. Según la documentación oficial de Apache Airflow, los flujos se definen como DAGs (grafos dirigidos acíclicos) escritos en Python.
Pensalo como un director de orquesta: no toca ningún instrumento, pero se asegura de que cada músico entre en el momento justo. Si tenés un proceso que extrae datos a la 1 AM, los transforma a las 2 y actualiza un dashboard a las 3, Airflow es quien coordina esa secuencia y avisa si algo se rompe.
¿Analista o data engineer?
Acá está la clave que casi nadie explica claro:
Los data engineers construyen y mantienen los pipelines en Airflow. Es una herramienta central de su rol.
Los analistas de datos rara vez necesitan construir DAGs desde cero. Les alcanza con entender qué hace Airflow para colaborar con el equipo y, a veces, disparar o modificar flujos existentes.
Si sos analista y estás decidiendo qué aprender, Airflow no debería ser tu prioridad frente a SQL, Python y visualización. Conviene conocerlo, no dominarlo. De hecho, priorizar bien qué herramientas aprender es una decisión estratégica: por eso vale la pena mirar de antemano qué habilidades de SQL piden las empresas, que siguen pesando más que la orquestación en la mayoría de los roles de análisis.
Airflow vs dbt vs Spark
Herramienta | Qué hace | Rol típico |
|---|---|---|
Airflow | Orquesta tareas y define cuándo corren | Data engineer |
dbt | Transforma datos dentro del warehouse con SQL | Analytics engineer / analista |
Spark | Procesa grandes volúmenes en paralelo | Data engineer |
La forma simple de recordarlo: Airflow decide cuándo corren las cosas, dbt transforma los datos con SQL una vez que ya están en el warehouse (su documentación oficial lo explica en detalle), y Spark hace el trabajo pesado de procesar volúmenes que no entran en una sola máquina. No compiten: muchas veces conviven en un mismo stack, con Airflow orquestando tareas que usan dbt y Spark.
Un hello world en Python
Así se ve un DAG mínimo en Airflow:
Este DAG ejecuta una función una vez por día. Cada tarea puede depender de otras, y Airflow se encarga de respetar el orden y reintentar si algo falla.
Cursos recomendados de Coderhouse
Para construir una base sólida en datos y en las herramientas que rodean a Airflow, estas opciones cubren distintos niveles:
Introducción a la Inteligencia Artificial: para entender cómo se combinan datos, pipelines e IA.
DevOps & Cloud: el más cercano al mundo de la orquestación y el despliegue de pipelines.
AI Engineering: para quienes quieren avanzar hacia roles técnicos que combinan datos e IA.
Empezá hoy: si sos analista, enfocá primero SQL y Python; si vas hacia data engineering, instalá Airflow localmente y corré el DAG de ejemplo para verlo en acción.
Preguntas frecuentes
¿Un analista de datos necesita aprender Airflow?
En general, no como prioridad. Conviene entender qué hace para colaborar con el equipo, pero construir pipelines en Airflow es tarea de data engineers. Como analista, SQL, Python y visualización deberían ir primero.
¿Airflow reemplaza a dbt o a Spark?
No, resuelven cosas distintas. Airflow orquesta (decide cuándo corren las tareas), dbt transforma datos con SQL y Spark procesa grandes volúmenes. Es común usarlos juntos en un mismo stack, no elegir uno sobre otro.
¿Airflow es difícil de aprender?
Requiere manejar Python y entender conceptos de pipelines, así que tiene una curva media. Los fundamentos (definir un DAG, encadenar tareas) se aprenden rápido; la complejidad aparece al escalar y monitorear flujos en producción.
¿Para qué se usa Airflow en una empresa real?
Para automatizar y coordinar procesos de datos: extraer información de fuentes, transformarla, actualizar dashboards y disparar reportes en horarios definidos. Su valor está en la confiabilidad: si una tarea falla, Airflow lo detecta, reintenta y avisa.

Sobre el autor
Soy Francisco Rhaiel, AI Growth Engineer en Coderhouse. Mi día a día consiste en automatizar y optimizar procesos aplicando lo último en inteligencia artificial, incluyendo Agentic AI y Gen AI. Soy graduado de la Universidad Torcuato Di Tella (UTDT) en Tecnología Digital, y mi recorrido me llevó a especializarme en la intersección entre tecnología, datos y negocio. Me mueve aprender, construir y aplicar tecnologías innovadoras para resolver problemas reales. Para profundizar en mi trayectoria, te espero en mi perfil de LinkedIn.

