Contacta con nosotros

Temario del curso

Infraestructura como Código de EXO

  • Visión general de patrones de implementación de EXO: nodos individuales, multi-nodo y clústeres RDMA
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones
  • Uso de Nix flakes para builds reproducibles de EXO y entornos de desarrollo
  • Redacción de playbooks de Ansible o scripts de shell para aprovisionamiento no supervisado de clústeres

Builds Reproducibles e Integración con CI

  • Fijar dependencias y construir el panel de control en tuberías de CI
  • Ejecutar pruebas básicas (smoke tests) de EXO en ejecutores de GitHub Actions o GitLab CI
  • Crear imágenes base y flujos de reversión basados en instantáneas para VMs de macOS y Linux
  • Versionar tarjetas de modelos personalizados junto con el código de la aplicación

Descubrimiento del Clúster y Automatización de Redes

  • Configuración de mDNS y DNS estático para el descubrimiento confiable de nodos libp2p
  • Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS
  • Uso de nombres de espacio personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción
  • Reglas de firewall y segmentación de red para entornos multi-inquilino

Gestión del Ciclo de Vida de Almacenamiento y Modelos

  • Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
  • Montaje de comparticiones NFS o SAN como repositorios de modelos de solo lectura para aprovisionamiento rápido
  • Colección de basura de cachés obsoletas y políticas de retención de pesos versionados
  • Automatización de la descarga previa de modelos y comprobaciones de salud antes de actualizaciones progresivas

Monitoreo y Alertas

  • Envío de logs de EXO a registros centralizados (ELK, Loki o Splunk)
  • Construcción de dashboards de Grafana a partir de la salida de EXO_TRACING_ENABLED
  • Alertas sobre cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia
  • Correlación de telemetría de hardware de macmon con regresiones de rendimiento del modelo

Actualizaciones, Reversiones y Recuperación ante Desastres

  • Pruebas de actualizaciones de binarios de EXO en un nodo canario antes de su despliegue generalizado
  • Reversión a nivel de modelo: cambio entre versiones cuantizadas sin necesidad de re-descarga
  • Respaldo y restauración del estado del clúster, nombres de espacio personalizados y pesos en caché
  • Documentación de runbooks de recuperación para escenarios de reconstrucción total del clúster

Endurecimiento de Seguridad y Cumplimiento

  • Aplicación de TLS en la capa de proxy inverso (nginx, traefik) para el panel de control y la API
  • Implementación de limitación de tasa de API y listado blanco de IPs para endpoints de EXO
  • Aislamiento de clústeres con VLANs y políticas de red de confianza cero
  • Auditoría de accesos y mantenimiento de un inventario de modelos implementados y sus versiones

Requerimientos

  • Experiencia con prácticas de DevOps (CI/CD, IaC, orquestación de contenedores)
  • Familiaridad con administración de sistemas macOS o Linux y gestión de paquetes
  • Comprensión de conceptos de redes, DNS y almacenamiento

Público Objetivo

  • Ingenieros de DevOps
  • Arquitectos de infraestructura
  • SREs responsables de cargas de trabajo de IA en local
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas