Adaptación de F5-Spanish
F5-TTS es un sistema de síntesis neuronal que tiene la capacidad de leer texto en voz alta de forma fluida, clara y muy parecida a cómo hablaría un ser humano.
Este sistema es capaz de imitar tu propia voz con una pequeña muestra gracias a que se han usado miles de horas de grabaciones hablando en múltiples idiomas y acentos. La Inteligencia Artificial aprendió cómo suenan las palabras, el tono y el ritmo del habla, todo esto para poder clonar voz en unos pocos segundos.
Debido al gran avance en este tipo de tecnologías, a día de hoy es muy difícil diferenciar cuando una voz es real o ha sido generado mediante inteligencia artificial.
Este problema ha llevado a muchas empresas a crear una posible solución. Como por ejemplo Meta con su software de marcado de audios generados con inteligencia artificial llamado audioseal. Pero con los conocimientos adquiridos en la asignatura somos capaces de poder diferenciar este tipo de problemas, o eso creemos.
A continuación podrás observar dos espectrogramas diferentes, uno corresponde a la voz real de una persona y el otro a un audio generado con inteligencia artificial a partir de audios de la misma persona.
En caso de que la API se encuentre en mantenimiento, aquí tienes otra forma sencilla de probar la síntesis, que solo tomará unos pocos pasos
GPU T4 Entorno de ejecución y vuelve a clicar en Ejecutar todasRunning on public URL: en el que deberás clicarConfiguraciones AvanzadasTe recomendamos que todos los audios de referencia que utilices sean de al menos 15 segundos y que los textos que quieras generar acaben siempre con un punto.