От акустики до генерации: распознавание речи (Whisper, RHVoice), синтез (TTS), клонирование голоса, генерация музыки, анализ аудио (Shazam)
Базовый модуль, вводящий в речевые технологии: акустика и фонетика, признаки речевого сигнала (MFCC, мел-спектрограмма), общий pipeline ASR/NLP/TTS и обзор отечественных разработок от формантного синтеза до RHVoice и нейронных систем.
Модуль посвящён автоматическому распознаванию речи (ASR): ключевые end-to-end архитектуры (CTC, RNN-T, seq2seq attention), универсальная модель OpenAI Whisper с обучением на слабых надзорах, отечественный open-source движок RHVoice и практические применения — транскрибирование совещаний, субтитры, диаризация и оценка качества через WER.
Модуль посвящён технологиям клонирования и конверсии голоса: speaker-embedings (d-vectors, x-vectors, ECAPA-TDNN), методам voice conversion (one-to-many, many-to-one, zero-shot, CycleGAN), а также этическим аспектам deepfake-голосов — рискам мошенничества, водяным знакам, детекторам и правовому регулированию в РФ.
Модуль посвящён генерации музыки и аудио с помощью ИИ: языковые модели на аудио-токенах (AudioLM, MusicGen), сервисы text-to-music (Suno, Udio), диффузионные модели для звука (Stable Audio, Riffusion) и музыкальная теория — темп, тональность, аккорды, такт и MIDI-представление, необходимая для понимания того, как AI учит структуру произведений.
Финальный модуль направления «Речь и аудио»: распознавание музыки по отпечатку (Shazam-подход), диаризация спикеров, аудио-тегирование и классификация звуковых событий, а также итоговое обобщение всего направления — востребованные профессии и маршруты дальнейшего изучения.