Contacta con nosotros

Temario del curso

Introducción a los modelos de visión-lenguaje

  • Vista general de los VLM y su papel en la IA multimodal.
  • Arquitecturas populares: CLIP, Flamingo, BLIP, entre otras.
  • Casos de uso: búsqueda, generación de descripciones (captioning), sistemas autónomos, análisis de contenido.

Preparación del entorno para el ajuste fino

  • Configuración de OpenCLIP y otras bibliotecas VLM.
  • Formatos de conjuntos de datos para pares imagen-texto.
  • Pipeline de preprocesamiento para entradas visuales y de lenguaje.

Ajuste fino de CLIP y modelos similares

  • Pérdida contrastiva y espacios de incrustación conjuntos.
  • Práctica: ajuste fino de CLIP en conjuntos de datos personalizados.
  • Gestión de datos específicos del dominio y multilingües.

Técnicas avanzadas de ajuste fino

  • Uso de LoRA y métodos basados en adaptadores para mayor eficiencia.
  • Ajuste de indicaciones (prompt tuning) e inyección de indicaciones visuales.
  • Compensaciones entre evaluación con pocos ejemplos (zero-shot) y evaluaciones tras ajuste fino.

Evaluación y establecimiento de referencias

  • Métricas para VLM: precisión en la recuperación, BLEU, CIDEr, tasa de acierto (recall).
  • Diagnósticos de alineación visual-texto.
  • Visualización de espacios de incrustación y clasificaciones erróneas.

Implementación y uso en aplicaciones reales

  • Exportación de modelos para inferencia (TorchScript, ONNX).
  • Integración de VLM en pipelines o APIs.
  • Consideraciones sobre recursos y escalado de modelos.

Casos de estudio y escenarios aplicados

  • Análisis de medios y moderación de contenido.
  • Búsqueda y recuperación en comercio electrónico y bibliotecas digitales.
  • Interacción multimodal en robótica y sistemas autónomos.

Resumen y próximos pasos

Requerimientos

  • Conocimiento de aprendizaje profundo aplicado a visión por computadora y procesamiento de lenguaje natural (NLP).
  • Experiencia con PyTorch y modelos basados en transformadores.
  • Conocimiento de arquitecturas de modelos multimodales.

Público objetivo

  • Ingenieros de visión por computadora.
  • Desarrolladores de IA.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas