Сравнение авторегрессионного Tacotron и параллельного FastSpeech: архитектура, внимание, предсказание длительностей.
Практические сценарии TTS: озвучка длинных текстов, turn-by-turn навигация, голосовые ассистенты, мобильный офлайн-синтез.
История развития систем синтеза речи: от ранних формантных синтезаторов до современных нейронных моделей.
End-to-end модели синтеза: VITS с вариационным выводом и нормализующими потоками, Bark от suno с многоязычностью и эмоциями.
Превращение мел-спектрограммы в аудиоволну: от алгоритма Griffin-Lim к нейронным вокодерам WaveNet и HiFi-GAN.