Ponte en Contacto
 Duración 21 horas

Temario del curso

Introducción a la IA multimodal y Ollama

  • Visión general del aprendizaje multimodal
  • Principales desafíos en la integración visión-lenguaje
  • Capacidades y arquitectura de Ollama

Configuración del entorno de Ollama

  • Instalación y configuración de Ollama
  • Trabajo con despliegue local de modelos
  • Integración de Ollama con Python y Jupyter

Trabajo con entradas multimodales

  • Integración de texto e imágenes
  • Incorporación de audio y datos estructurados
  • Diseño de flujos de trabajo de preprocesamiento

Aplicaciones de comprensión de documentos

  • Extracción de información estructurada de PDFs e imágenes
  • Combinación de OCR con modelos de lenguaje
  • Construcción de flujos de trabajo de análisis de documentos inteligentes

Preguntas y respuestas visuales (VQA)

  • Configuración de conjuntos de datos y benchmarks de VQA
  • Entrenamiento y evaluación de modelos multimodales
  • Construcción de aplicaciones de VQA interactivas

Diseño de agentes multimodales

  • Principios de diseño de agentes con razonamiento multimodal
  • Combinación de percepción, lenguaje y acción
  • Despliegue de agentes para casos de uso reales

Integración y optimización avanzadas

  • Ajuste fino (fine-tuning) de modelos multimodales con Ollama
  • Optimización del rendimiento de inferencia
  • Consideraciones sobre escalabilidad y despliegue

Resumen y próximos pasos

Requerimientos

  • Sólido conocimiento de los conceptos de aprendizaje automático (machine learning)
  • Experiencia con marcos de aprendizaje profundo como PyTorch o TensorFlow
  • Familiaridad con el procesamiento del lenguaje natural y la visión por computadora

Público objetivo

  • Ingenieros de aprendizaje automático
  • Investigadores en IA
  • Desarrolladores de productos que integren flujos de trabajo de visión y texto

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas