Основы речевых технологий

Базовый модуль, вводящий в речевые технологии: акустика и фонетика, признаки речевого сигнала (MFCC, мел-спектрограмма), общий pipeline ASR/NLP/TTS и обзор отечественных разработок от формантного синтеза до RHVoice и нейронных систем.

← Назад к направлению
⏱ 60 мин 📖 5 теорий 📝 2 кейсов

📚 Микро-теория

Акустика и фонетика: звук как сигнал

Физические основы звука: частота, амплитуда, форманты, фонемы русского языка и спектрограмма как основной инструмент анализа.

15 мин

АЦП, PCM и шум квантования: из аналога в цифру

Аналого-цифровое преобразование, импульсно-кодовая модуляция (PCM), частота дискретизации, разрядность, шум квантования, битрейт и форматы аудио.

10 мин

Признаки речевого сигнала: MFCC, мел-спектрограмма

Извлечение признаков из речевого сигнала: оконное преобразование, FFT, mel-шкала, кепстр, MFCC и filterbank features.

15 мин

Отечественные разработки: RHVoice и история речевых технологий в СССР/России

История речевых технологий в СССР и России: от формантного синтеза до RHVoice Ольги Яковлевой и современных нейронных систем.

15 мин

Pipeline речевых технологий: речь → текст → речь

Архитектура речевого конвейера: микрофоны как вход, ASR, NLP-обработка, TTS; сравнение гибридного и end-to-end подходов.

15 мин

🎯 Практические кейсы

Вычисление MFCC на numpy
Средний ⏱ 30 мин
MFCC numpy DSP
Подавление шума методом спектрального вычитания на numpy
Средний ⏱ 30 мин
noise-reduction STFT numpy DSP

🧠 Проверь себя

💬 Чат с наставником

Привет! 👋

Я помогу тебе освоить ИИ-компетенции. С чего начнём?