Модуль посвящён генерации музыки и аудио с помощью ИИ: языковые модели на аудио-токенах (AudioLM, MusicGen), сервисы text-to-music (Suno, Udio), диффузионные модели для звука (Stable Audio, Riffusion) и музыкальная теория — темп, тональность, аккорды, такт и MIDI-представление, необходимая для понимания того, как AI учит структуру произведений.
Нейрокодеки (EnCodec, SoundStream), дискретные audio tokens и авторегрессионная генерация звука по примеру языковых моделей.
Stable Audio, Riffusion и score-based генерация: спектрограмма как изображение, диффузия в латентном пространстве звука.
Темп, тональность, аккорды, такт, паттерны и MIDI-представление — как AI учит музыкальную структуру.
Сервисы text-to-music, генерирующие песни с вокалом и музыкой: структура произведения и промпт-инжиниринг для музыки.