Синтез речи

← Назад к направлению
⏱ 70 мин 📖 5 теорий 📝 1 кейсов

📚 Микро-теория

Tacotron и FastSpeech: авторегрессионный vs параллельный

Сравнение авторегрессионного Tacotron и параллельного FastSpeech: архитектура, внимание, предсказание длительностей.

18 мин

Применения: озвучка книг, GPS-навигаторы, ассистенты

Практические сценарии TTS: озвучка длинных текстов, turn-by-turn навигация, голосовые ассистенты, мобильный офлайн-синтез.

12 мин

Эволюция TTS: от формантного к нейронному

История развития систем синтеза речи: от ранних формантных синтезаторов до современных нейронных моделей.

15 мин

VITS и Bark: end-to-end синтез

End-to-end модели синтеза: VITS с вариационным выводом и нормализующими потоками, Bark от suno с многоязычностью и эмоциями.

16 мин

Вокодеры: Griffin-Lim, WaveNet, HiFi-GAN

Превращение мел-спектрограммы в аудиоволну: от алгоритма Griffin-Lim к нейронным вокодерам WaveNet и HiFi-GAN.

14 мин

🎯 Практические кейсы

Мини-TTS pipeline на numpy
Средний ⏱ 35 мин
TTS numpy pipeline

🧠 Проверь себя

💬 Чат с наставником

Привет! 👋

Я помогу тебе освоить ИИ-компетенции. С чего начнём?