Модуль посвящён автоматическому распознаванию речи (ASR): ключевые end-to-end архитектуры (CTC, RNN-T, seq2seq attention), универсальная модель OpenAI Whisper с обучением на слабых надзорах, отечественный open-source движок RHVoice и практические применения — транскрибирование совещаний, субтитры, диаризация и оценка качества через WER.
Практические сценарии ASR: real-time vs offline распознавание, диаризация спикеров, шумоподавление, оценка точности через WER и специфика русского языка.
Три ключевых end-to-end подхода к распознаванию речи: Connectionist Temporal Classification, RNN Transducer и seq2seq с вниманием, их сильные и слабые стороны.
Свободный речевой движок RHVoice Ольги Яковлевой: архитектура, голоса Alexander/Anna, сравнение с нейронным TTS и применение в навигаторах и читалках.
Модель OpenAI Whisper: обучение на слабых надзорах, мультиязычность, encoder-decoder архитектура и применение для русского языка.