Back

Síntesis Neuronal

Adaptación de F5-Spanish

¿Qué es F5-TTS y qué hace?

F5-TTS es un sistema de síntesis neuronal que tiene la capacidad de leer texto en voz alta de forma fluida, clara y muy parecida a cómo hablaría un ser humano.

Este sistema es capaz de imitar tu propia voz con una pequeña muestra gracias a que se han usado miles de horas de grabaciones hablando en múltiples idiomas y acentos. La Inteligencia Artificial aprendió cómo suenan las palabras, el tono y el ritmo del habla, todo esto para poder clonar voz en unos pocos segundos.

¿Cómo funciona?

  1. Entrada de texto para convertir a voz.
  2. Entrada de fragmento de voz a replicar.
  3. Texto del fragmento de voz a replicar.
  4. El sistema empieza a generar la voz (comienza como ruido y termina en una voz clara, fluida y muy parecida).
    • ConvNeXT ayuda al sistema a entender mejor el texto.
    • Diffusion Transformer genera la voz (desde el ruido hasta la voz clara).
  5. Se aplica Sway Sampling, que permite que los primeros pasos del modelo (los más importantes) se hagan con más detalle. Así se mejora el ritmo y tono general de la voz.

Retos generados

Debido al gran avance en este tipo de tecnologías, a día de hoy es muy difícil diferenciar cuando una voz es real o ha sido generado mediante inteligencia artificial.

Este problema ha llevado a muchas empresas a crear una posible solución. Como por ejemplo Meta con su software de marcado de audios generados con inteligencia artificial llamado audioseal. Pero con los conocimientos adquiridos en la asignatura somos capaces de poder diferenciar este tipo de problemas, o eso creemos.

A continuación podrás observar dos espectrogramas diferentes, uno corresponde a la voz real de una persona y el otro a un audio generado con inteligencia artificial a partir de audios de la misma persona.

Espectrograma Real
Espectrograma IA

Sube un archivo de audio (.wav):










Audio generado:

Espectrograma:

En caso de que la API se encuentre en mantenimiento, aquí tienes otra forma sencilla de probar la síntesis, que solo tomará unos pocos pasos

Te recomendamos que todos los audios de referencia que utilices sean de al menos 15 segundos y que los textos que quieras generar acaben siempre con un punto.