Распознавание речи

Модуль посвящён автоматическому распознаванию речи (ASR): ключевые end-to-end архитектуры (CTC, RNN-T, seq2seq attention), универсальная модель OpenAI Whisper с обучением на слабых надзорах, отечественный open-source движок RHVoice и практические применения — транскрибирование совещаний, субтитры, диаризация и оценка качества через WER.

← Назад к направлению
⏱ 60 мин 📖 4 теорий 📝 1 кейсов

📚 Микро-теория

Применения: автотранскрибирование совещаний, субтитры

Практические сценарии ASR: real-time vs offline распознавание, диаризация спикеров, шумоподавление, оценка точности через WER и специфика русского языка.

15 мин

Архитектуры ASR: CTC, RNN-T, attention

Три ключевых end-to-end подхода к распознаванию речи: Connectionist Temporal Classification, RNN Transducer и seq2seq с вниманием, их сильные и слабые стороны.

15 мин

RHVoice: отечественный open-source речевой движок

Свободный речевой движок RHVoice Ольги Яковлевой: архитектура, голоса Alexander/Anna, сравнение с нейронным TTS и применение в навигаторах и читалках.

15 мин

Whisper: универсальный распознаватор речи

Модель OpenAI Whisper: обучение на слабых надзорах, мультиязычность, encoder-decoder архитектура и применение для русского языка.

15 мин

🎯 Практические кейсы

Расчёт WER: оценка качества распознавания
Средний ⏱ 25 мин
WER ASR метрики

🧠 Проверь себя

💬 Чат с наставником

Привет! 👋

Я помогу тебе освоить ИИ-компетенции. С чего начнём?