Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas (2 días)
Temario del curso
Introducción a la síntesis de voz y la clonación de voz
- Visión general de la síntesis de voz a texto (TTS) y la síntesis de voz neuronal.
- Clonación de voz frente a generación de habla: casos de uso y límites.
- Modelos clave: Tacotron, WaveNet, FastSpeech, VITS.
Trabajo con plataformas comerciales
- Uso de ElevenLabs y Resemble AI.
- Creación, clonación y edición de voces.
- Acceso a APIs y flujos de trabajo de texto a voz.
Construcción con herramientas de código abierto
- Instalación y configuración de Coqui TTS.
- Entrenamiento de voces personalizadas y gestión de conjuntos de datos.
- Generación de habla con control fino (tono, velocidad, emoción).
Preparación de datos y gestión de conjuntos de datos de voz
- Recopilación y limpieza de muestras de voz.
- Segmentación, etiquetado y alineación de transcripciones.
- Adquisición ética y consentimiento de voz.
Integración en aplicaciones
- Incrustación de TTS en sitios web y aplicaciones.
- Creación de sistemas IVR y bots interactivos.
- Generación de diálogo sintético para videojuegos y películas.
Evaluación de calidad y realismo
- Pruebas de MOS (Puntuación de Opinión Media) e inteligibilidad.
- Control de la expresividad y la prosodia.
- Comparación de latencia, fidelidad y realismo.
Consideraciones éticas, legales y de gobernanza
- Riesgos del deepfake y uso responsable.
- Consentimiento, atribución e implicaciones del derecho de autor.
- Regulaciones y políticas organizacionales.
Resumen y próximos pasos
Requerimientos
- Comprensión de los fundamentos del aprendizaje automático.
- Familiaridad con formatos de archivos de audio y herramientas de edición.
- Habilidades básicas en programación con Python.
Público objetivo
- Desarrolladores e ingenieros de IA interesados en la síntesis de voz.
- Creadores de contenido y tecnólogos de medios que exploran la generación de voz.
- Equipos de I+D que construyen sistemas de audio personalizados o dinámicos.