Финальный модуль направления «Речь и аудио»: распознавание музыки по отпечатку (Shazam-подход), диаризация спикеров, аудио-тегирование и классификация звуковых событий, а также итоговое обобщение всего направления — востребованные профессии и маршруты дальнейшего изучения.
Environmental sounds, sound event detection (SED), датасеты UrbanSound и ESC-50, CNN на спектрограммах.
Сегментация речи, кластеризация спикеров, VAD (voice activity detection) и обработка перекрытий (overlap handling).
Recap всего направления «Речь и аудио»: связь модулей, востребованные профессии и что изучать дальше.
Audio fingerprinting: constellation map пиков спектрограммы, хеширование пар точек, поиск по базе и робастность к шуму.