Клонирование и конверсия голоса

Модуль посвящён технологиям клонирования и конверсии голоса: speaker-embedings (d-vectors, x-vectors, ECAPA-TDNN), методам voice conversion (one-to-many, many-to-one, zero-shot, CycleGAN), а также этическим аспектам deepfake-голосов — рискам мошенничества, водяным знакам, детекторам и правовому регулированию в РФ.

← Назад к направлению
⏱ 40 мин 📖 3 теорий 📝 1 кейсов

📚 Микро-теория

Этика deepfake-голосов: защита и риски

Угрозы синтезированной речи, методы защиты, детекции и правовое регулирование в Российской Федерации.

15 мин

Speaker embedding: представление голоса

Как превратить голос человека в компактный вектор, отделив «что сказано» от «кем сказано».

12 мин

Voice conversion: смена голоса

Методы преобразования голоса одного говорящего в голос другого: от параллельных корпусов до zero-shot клонирования.

13 мин

🎯 Практические кейсы

Сходство голосов: cosine similarity на синтетике
Средний ⏱ 25 мин
speaker embedding similarity

💬 Чат с наставником

Привет! 👋

Я помогу тебе освоить ИИ-компетенции. С чего начнём?