Ponte en Contacto

Temario del curso

El Panorama de la Observabilidad con IA

  • De los paneles a las conversaciones: el cambio hacia una observabilidad aumentada por IA.
  • Capacidades de LLM relevantes para la observabilidad: resumimiento, razonamiento, coincidencia de patrones.
  • Patrones de arquitectura: integrar IA en las pilas de observabilidad existentes.

Consulta de Telemetría por Lenguaje Natural

  • De texto a PromQL: traducir lenguaje natural en consultas de monitoreo.
  • Consultas en lenguaje natural para almacenes de registros de Elasticsearch, OpenSearch y Loki.
  • Generación de SQL desde lenguaje natural para telemetría estructurada.
  • Construcción de un agente asistente de consultas con uso de herramientas y conciencia del contexto.

Análisis de Registros Alimentado por LLMs

  • Parseo y estructuración automatizada de registros con LLMs.
  • Detección de anomalías en flujos de registros utilizando similitud de embeddings.
  • Agrupamiento de registros y descubrimiento de patrones a gran escala.
  • Generación de explicaciones legibles por humanos a partir de secuencias de registro sin procesar.

Alertas Inteligentes y Enriquecimiento de Incidentes

  • Correlación y deduplicación de alertas con comprensión semántica.
  • Recopilación automatizada de contexto del incidente a partir de libros de ejecución (runbooks), incidentes anteriores y documentación.
  • Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
  • Reducción de la fatiga de alertas mediante reducción de ruido impulsada por IA.

Análisis de Causa Raíz Asistido por IA

  • Generación de hipótesis a partir de la correlación de telemetría multisource.
  • Cadenas de evidencia: conectar síntomas entre métricas, registros y trazas.
  • Troubleshooting guiado con sesiones de diagnóstico interactivo con IA.
  • Construcción de un agente de análisis de causa raíz con investigación progresiva.

Respuesta Automatizada a Incidentes y Comunicación

  • Generación de resúmenes de incidentes y actualizaciones de estado a partir de la telemetría.
  • Borrado automático de postmortem con reconstrucción de la línea de tiempo.
  • Comunicación con stakeholders adaptada para audiencias técnicas y ejecutivas.
  • Sugerencia de libros de ejecución y recomendaciones de remediación automatizada.

Máquinas de Aprendizaje (ML) para Observabilidad

  • Pronóstico de series temporales para planificación de capacidad y predicción de anomalías.
  • Modelos base para detección de anomalías en métricas sin entrenamiento previo (zero-shot).
  • Mapeo de dependencias de servicios basado en embeddings y descubrimiento de topología.
  • Entrenamiento e implementación de modelos de ML ligeros junto a los pipelines de observabilidad.

Implementación en Producción y Ética

  • Consideraciones de latencia y costo para la observabilidad con IA en tiempo real.
  • Privacidad de datos: asegurar que los LLMs no filtren telemetría sensible.
  • Supervisión humana: cuándo el diagnóstico de IA requiere validación por parte del operador.
  • Medición del impacto: MTTD, MTTR y métricas de la experiencia de guardia (on-call).

Requerimientos

  • Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
  • Familiaridad con conceptos de gestión de registros y métricas.
  • Conocimientos básicos de scripting en Python para procesamiento de datos.

Audiencia Objetivo

  • Ingenieros de SRE y observabilidad adoptando herramientas mejoradas con IA.
  • Ingenieros de plataforma que construyen pipelines de monitoreo de próxima generación.
  • Líderes de DevOps que evalúan la integración de LLMs en flujos de trabajo de incidentes.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas