Modelo generativo autoregresivo para la síntesis de audio realista
WaveNet es un modelo generativo autoregresivo desarrollado por DeepMind que produce directamente ondas de audio crudas (*raw waveforms*). A diferencia de los métodos tradicionales que utilizan concatenación o vocoders paramétricos, WaveNet genera audio muestra por muestra, modelando su distribución probabilística condicional de forma precisa, es decir, es un modelo basado en la síntesis neuronal.
Para preservar la direccionalidad temporal (pasado → futuro), WaveNet emplea convoluciones causales. Estas aseguran que cada predicción solo dependa del presente y el pasado, nunca del futuro.
Sin embargo, una sola capa de convoluciónOperación que se aplica sobre datos (como imágenes, señales de audio o texto) para extraer patrones locales. causal tiene un contexto limitado. Para remediar esto, se utilizan convoluciones dilatadas, que expanden el campo receptivo de la red exponencialmente sin incrementar drásticamente los parámetros.
Por otro lado tenemos la dilatación
que permite que la red tenga más contexto que con una convolución normal. Es similar a las convoluciones de agrupamiento o estriadas, pero la salida tiene el mismo tamaño que la entrada.
La función softmax es una función matemática que convierte un vector de números reales en una distribución de probabilidad. Es ampliamente utilizada en redes neuronales, especialmente en las capas de salida cuando se quiere modelar una variable categórica, como en la generación de texto o audio donde hay que elegir el siguiente símbolo (por ejemplo, una muestra de audio cuantizada). Para modelar la distribución de convoluciones causales dilatadas (Distribución Condicional) usamos la función Softmax ya que puede manejar una gran cantidad de posibles valores de salida y es lo suficientemente flexible para capturar la complejidad de las señales de audio.
Antes de aplicar la función Softmax, los valores de audio se transforman utilizando la µ-law (ley A), dónde μ = 255. Después de aplicar µ-law, los valores de audio transformados se cuantizan y en el caso de WaveNet, se cuantiza con 256 niveles.
Después de cuantizar la señal de audio, cada valor cuantizado representa un nivel diferente. La función Softmax convierte los logits (valores de entrada) en probabilidades para cada uno de los niveles además se asegura que la suma de todas las probabilidades sea igual a 1, permitiendo interpretar los valores como probabilidades de pertenencia a cada uno de los 256 niveles.
Si el nivel 80 tiene una probabilidad de 0.04, esto significa que, según la función Softmax, la probabilidad de que la siguiente muestra de audio sea cuantizada al nivel 80 es del 4%. En otras palabras, de todas los posibles niveles cuantizados, el nivel 80 tiene una probabilidad del 4% de ser el valor de la siguiente muestra de audio.
Los Context Stacks son una estructura complementaria que se añade encima del WaveNet principal para aumentar aún más su capacidad para capturar dependencias a largo plazo, con ello logramos recordar y usar información de eventos pasados lejanos en el tiempo, cuando está generando o procesando una nueva parte de la señal.
Esto ayuda a que al haccer la narración del texto suene fluido sin y natural con pausas del habla imitando el compartamiento más humano. Aunque WaveNet ya usa convoluciones dilatadas para aumentar su campo de visión, añadir estas capas ayuda a no aumentar tanto el coste computacional.
WaveNet puede ser extendido para generar audio condicionado a diferentes tipos de entradas. Estas redes de ondas condicionales permiten que el modelo produzca diferentes resultados basados en contexto adicional.
Tacotron es un modelo secuencia-a-secuencia (seq2seq) que convierte texto directamente en espectrogramas mel, los cuales luego pueden ser transformados en audio usando WaveNet como vocoder. Este enfoque combinado es la base de sistemas como Google Cloud TTS.
Tecnología generativa basada en redes neuronales profundas
Síntesis tradicional basada en unidades acústicas
Los espectrogramas revelan cómo WaveNet supera las limitaciones del método paramétrico:
Esta superioridad técnica se traduce en una experiencia auditiva indistinguible de voz humana en aplicaciones reales.