Temario del curso
Introducción, objetivos y estrategia de migración
- Objetivos del curso, alineación del perfil del participante y criterios de éxito
- Enfoques de migración de alto nivel y consideraciones sobre riesgos
- Configuración de espacios de trabajo, repositorios y conjuntos de datos del laboratorio
Día 1 — Fundamentos de migración y arquitectura
- Conceptos de Lakehouse, descripción general de Delta Lake y arquitectura de Databricks
- Diferencias entre SMP y MPP e implicaciones para la migración
- Diseño Medallion (Bronze→Silver→Gold) y descripción general de Unity Catalog
Práctico del Día 1 — Traducción de un procedimiento almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un notebook
- Correspondencia de tablas temporales y cursores con transformaciones de DataFrame
- Validación y comparación con la salida original
Día 2 — Delta Lake avanzado y carga incremental
- Transacciones ACID, registros de confirmación, versionamiento y viaje en el tiempo (time travel)
- Auto Loader, patrones MERGE INTO, actualizaciones/inserciones (upserts) y evolución de esquema
- OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento
Práctico del Día 2 — Ingesta incremental y optimización
- Implementación de la ingesta con Auto Loader y flujos de trabajo MERGE
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
- Medición de las mejoras en el rendimiento de lectura/escritura
Día 3 — SQL en Databricks, rendimiento y depuración
- Funcionalidades de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
- Lectura de la interfaz de Spark UI, DAGs, mezclas (shuffles), etapas, tareas y diagnóstico de cuellos de botella
- Patrones de ajuste de consultas: uniones de difusión (broadcast joins), indicios (hints), caché y reducción de desbordamiento (spill)
Práctico del Día 3 — Reestructuración de SQL y ajuste de rendimiento
- Reestructuración de un proceso SQL pesado en Spark SQL optimizado
- Uso de trazas de Spark UI para identificar y corregir problemas de desbalance (skew) y mezcla (shuffle)
- Comparación de rendimiento antes/después y documentación de los pasos de ajuste
Día 4 — PySpark táctico: Reemplazo de la lógica procedural
- Modelo de ejecución de Spark: conductor (driver), ejecutores, evaluación perezosa y estrategias de particionamiento
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
- Modularización, UDFs/pandas UDFs, widgets y bibliotecas reutilizables
Práctico del Día 4 — Reestructuración de scripts procedurales
- Reestructuración de un script ETL procedural en notebooks de PySpark modulares
- Introducción a la parametrización, pruebas de tipo unidad y funciones reutilizables
- Revisión de código y aplicación de la lista de verificación de mejores prácticas
Día 5 — Orquestación, flujo de trabajo de extremo a extremo y mejores prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes y manejo de errores
- Diseño de flujos Medallion incrementales con reglas de calidad y validación de esquema
- Integración con Git (GitHub/Azure DevOps), integración continua (CI) y estrategias de pruebas para lógica de PySpark
Práctico del Día 5 — Construcción de un flujo de trabajo completo de extremo a extremo
- Ensamblaje del flujo Bronze→Silver→Gold orquestado con Workflows
- Implementación de registro (logging), auditoría, reintentos y validaciones automatizadas
- Ejecución del flujo completo, validación de salidas y preparación de notas de despliegue
Operacionalización, gobernanza y preparación para producción
- Mejores prácticas de gobernanza, linaje y controles de acceso de Unity Catalog
- Costos, dimensionamiento de clústeres, escalado automático y patrones de concurrencia de trabajos
- Listas de verificación de despliegue, estrategias de reversión (rollback) y creación de manuales de operaciones (runbooks)
Revisión final, transferencia de conocimientos y próximos pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación
- Referencias, rutas de aprendizaje adicionales y opciones de soporte
Requerimientos
- Conocimiento de conceptos de ingeniería de datos
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
- Familiaridad con conceptos de orquestación ETL (ADF o similar)
Público objetivo
- Gerentes de tecnología con antecedentes en ingeniería de datos
- Ingenieros de datos que migran lógica procedural de OLAP a patrones Lakehouse
- Ingenieros de plataforma responsables de la adopción de Databricks
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.