Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Infraestructura como Código de EXO
- Visión general de patrones de implementación de EXO: nodos individuales, multi-nodo y clústeres RDMA
- Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones
- Uso de Nix flakes para builds reproducibles de EXO y entornos de desarrollo
- Redacción de playbooks de Ansible o scripts de shell para aprovisionamiento no supervisado de clústeres
Builds Reproducibles e Integración con CI
- Fijar dependencias y construir el panel de control en tuberías de CI
- Ejecutar pruebas básicas (smoke tests) de EXO en ejecutores de GitHub Actions o GitLab CI
- Crear imágenes base y flujos de reversión basados en instantáneas para VMs de macOS y Linux
- Versionar tarjetas de modelos personalizados junto con el código de la aplicación
Descubrimiento del Clúster y Automatización de Redes
- Configuración de mDNS y DNS estático para el descubrimiento confiable de nodos libp2p
- Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS
- Uso de nombres de espacio personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción
- Reglas de firewall y segmentación de red para entornos multi-inquilino
Gestión del Ciclo de Vida de Almacenamiento y Modelos
- Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
- Montaje de comparticiones NFS o SAN como repositorios de modelos de solo lectura para aprovisionamiento rápido
- Colección de basura de cachés obsoletas y políticas de retención de pesos versionados
- Automatización de la descarga previa de modelos y comprobaciones de salud antes de actualizaciones progresivas
Monitoreo y Alertas
- Envío de logs de EXO a registros centralizados (ELK, Loki o Splunk)
- Construcción de dashboards de Grafana a partir de la salida de EXO_TRACING_ENABLED
- Alertas sobre cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia
- Correlación de telemetría de hardware de macmon con regresiones de rendimiento del modelo
Actualizaciones, Reversiones y Recuperación ante Desastres
- Pruebas de actualizaciones de binarios de EXO en un nodo canario antes de su despliegue generalizado
- Reversión a nivel de modelo: cambio entre versiones cuantizadas sin necesidad de re-descarga
- Respaldo y restauración del estado del clúster, nombres de espacio personalizados y pesos en caché
- Documentación de runbooks de recuperación para escenarios de reconstrucción total del clúster
Endurecimiento de Seguridad y Cumplimiento
- Aplicación de TLS en la capa de proxy inverso (nginx, traefik) para el panel de control y la API
- Implementación de limitación de tasa de API y listado blanco de IPs para endpoints de EXO
- Aislamiento de clústeres con VLANs y políticas de red de confianza cero
- Auditoría de accesos y mantenimiento de un inventario de modelos implementados y sus versiones
Requerimientos
- Experiencia con prácticas de DevOps (CI/CD, IaC, orquestación de contenedores)
- Familiaridad con administración de sistemas macOS o Linux y gestión de paquetes
- Comprensión de conceptos de redes, DNS y almacenamiento
Público Objetivo
- Ingenieros de DevOps
- Arquitectos de infraestructura
- SREs responsables de cargas de trabajo de IA en local
21 Horas
Reseñas (2)
El conocimiento y experiencia del consultor ya que se abordan los temas teóricos aplicándolos a la realidad de los procesos. El curso contiene un programa de mucho valor en la gestión de las tecnologías de información.
Luis Castro Gamboa - Cooperativa De Ahorro Y Credito Ande No. 1 R.L.
Curso - Site Reliability Engineering (SRE) Foundation®
Que fue muy claro en cada especificación