Ponte en Contacto
 Duración 35 horas

Temario del curso

Introducción, Objetivos y Estrategia de Migración

  • Objetivos del curso, alineación del perfil de los participantes y criterios de éxito.
  • Enfoques de migración a alto nivel y consideraciones de riesgo.
  • Configuración de espacios de trabajo, repositorios y conjuntos de datos para el laboratorio.

Día 1 — Fundamentos de Migración y Arquitectura

  • Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks.
  • Diferencias entre SMP y MPP e implicaciones para la migración.
  • Diseño Medallion (Bronce→Plata→Oro) y visión general de Unity Catalog.

Laboratorio del Día 1 — Traducción de un Procedimiento Almacenado

  • Migración práctica de un procedimiento almacenado de ejemplo a un notebook.
  • Mapeo de tablas temporales y cursores a transformaciones de DataFrame.
  • Validación y comparación con la salida original.

Día 2 — Delta Lake Avanzado y Carga Incremental

  • Transacciones ACID, registros de commits, versionado y viaje en el tiempo.
  • Auto Loader, patrones MERGE INTO, actualizaciones/insertaciones (upserts) y evolución de esquemas.
  • OPTIMIZE, VACUUM, Z-ORDER, particionado y ajuste de almacenamiento.

Laboratorio del Día 2 — Ingestión Incremental y Optimización

  • Implementación de ingestión con Auto Loader y flujos de trabajo MERGE.
  • Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados.
  • Medición de mejoras en el rendimiento de lectura/escritura.

Día 3 — SQL en Databricks, Rendimiento y Depuración

  • Características de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arreglos.
  • Lectura de la interfaz de Spark, DAGs, intercambios (shuffles), etapas, tareas y diagnóstico de cuellos de botella.
  • Patrones de ajuste de consultas: uniones de difusión (broadcast joins), pistas (hints), caché y reducción de desbordamiento (spill).

Laboratorio del Día 3 — Refactorización de SQL y Ajuste de Rendimiento

  • Refactorizar un proceso SQL pesado en SQL de Spark optimizado.
  • Usar trazas de la interfaz de Spark para identificar y corregir problemas de sesgo (skew) e intercambio (shuffle).
  • Realizar pruebas de rendimiento antes/después y documentar los pasos de ajuste.

Día 4 — PySpark Táctico: Reemplazo de Lógica Procedimental

  • Modelo de ejecución de Spark: conductor (driver), ejecutores, evaluación perezosa y estrategias de particionado.
  • Transformar bucles y cursores en operaciones vectorizadas de DataFrame.
  • Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables.

Laboratorio del Día 4 — Refactorización de Scripts Procedimentales

  • Refactorizar un script ETL procedimental en notebooks de PySpark modulares.
  • Introducir parametrización, pruebas de estilo de unidad y funciones reutilizables.
  • Revisión de código y aplicación de listas de verificación de mejores prácticas.

Día 5 — Orquestación, Pipeline de Extremo a Extremo y Mejores Prácticas

  • Databricks Workflows: diseño de trabajos, dependencias de tareas, disparadores y manejo de errores.
  • Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquemas.
  • Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica de PySpark.

Laboratorio del Día 5 — Construcción de un Pipeline Completo de Extremo a Extremo

  • Ensamblar un pipeline Bronce→Plata→Oro orquestado con Workflows.
  • Implementar registro, auditoría, reintentos y validaciones automatizadas.
  • Ejecutar el pipeline completo, validar salidas y preparar notas de despliegue.

Operativización, Gobernanza y Listo para Producción

  • Mejores prácticas de gobernanza, linaje y controles de acceso en Unity Catalog.
  • Costos, dimensionado de clústeres, autoescalado y patrones de concurrencia de trabajos.
  • Listas de verificación de despliegue, estrategias de reversión (rollback) y creación de manuales de operación (runbooks).

Revisión Final, Transferencia de Conocimiento y Próximos Pasos

  • Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas.
  • Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación.
  • Referencias, rutas de aprendizaje adicionales y opciones de soporte.

Requerimientos

  • Comprensión de los conceptos de ingeniería de datos.
  • Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server).
  • Conocimiento de los conceptos de orquestación ETL (ADF o similares).

Audiencia

  • Gerentes de tecnología con antecedentes en ingeniería de datos.
  • Ingenieros de datos que transicionan la lógica OLAP procedimental a patrones de Lakehouse.
  • Ingenieros de plataforma responsables de la adopción de Databricks.

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas