Ponte en Contacto
 Duración 14 horas

Temario del curso

Visión general de las tecnologías de reconocimiento de voz <\/p>

  • Historia y evolución del reconocimiento de voz <\/li>
  • Modelos acústicos, modelos de lenguaje y decodificación <\/li>
  • Arquitecturas modernas: RNN, transformadores y Whisper <\/li> <\/ul>

    Preprocesamiento de audio y fundamentos de la transcripción <\/p>

    • Manejo de formatos de audio y tasas de muestreo <\/li>
    • Limpieza, recorte y segmentación del audio <\/li>
    • Generación de texto desde audio: tiempo real vs por lotes <\/li> <\/ul>

      Práctica con Whisper y otras API <\/p>

      • Instalación y uso de Whisper de OpenAI <\/li>
      • Llamado de API en la nube (Google, Azure) para transcripción <\/li>
      • Comparación de rendimiento, latencia y costo <\/li> <\/ul>

        Lenguaje, acentos y adaptación al dominio <\/p>

        • Trabajo con múltiples idiomas y acentos <\/li>
        • Vocabularios personalizados y tolerancia al ruido <\/li>
        • Manejo de lenguaje legal, médico o técnico <\/li> <\/ul>

          Formateo de salida e integración <\/p>

          • Adición de marcas de tiempo, puntuación y etiquetas de hablante <\/li>
          • Exportación a formatos de texto, SRT o JSON <\/li>
          • Integración de transcripciones en aplicaciones o bases de datos <\/li> <\/ul>

            Laboratorios de implementación de casos de uso <\/p>

            • Transcripción de reuniones, entrevistas o pódcast <\/li>
            • Sistemas de comandos de voz a texto <\/li>
            • Subtítulos en tiempo real para flujos de video/audio <\/li> <\/ul>

              Evaluación, limitaciones y ética <\/p>

              • Métricas de precisión y referencia de modelos <\/li>
              • Sesgo y equidad en los modelos de voz <\/li>
              • Consideraciones de privacidad y cumplimiento <\/li> <\/ul>

                Resumen y próximos pasos <\/p>

Requerimientos

  • Comprensión de conceptos generales de IA y aprendizaje automático <\/li>
  • Familiaridad con formatos y herramientas de archivos de audio o multimedia <\/li> <\/ul>

    Público objetivo <\/p>

    • Científicos de datos e ingenieros de IA que trabajan con datos de voz <\/li>
    • Desarrolladores de software que crean aplicaciones basadas en transcripción <\/li>
    • Organizaciones que exploran el reconocimiento de voz para la automatización <\/li> <\/ul>

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas