Модуль посвящён технологиям клонирования и конверсии голоса: speaker-embedings (d-vectors, x-vectors, ECAPA-TDNN), методам voice conversion (one-to-many, many-to-one, zero-shot, CycleGAN), а также этическим аспектам deepfake-голосов — рискам мошенничества, водяным знакам, детекторам и правовому регулированию в РФ.
Угрозы синтезированной речи, методы защиты, детекции и правовое регулирование в Российской Федерации.
Как превратить голос человека в компактный вектор, отделив «что сказано» от «кем сказано».
Методы преобразования голоса одного говорящего в голос другого: от параллельных корпусов до zero-shot клонирования.