简单且可控的音乐生成
声音
2024-01-31 v3 人工智能
机器学习
音频与语音处理
摘要
我们致力于条件音乐生成任务。我们提出了 MusicGen,一种在多个压缩离散音乐表示(即 token)流上运行的单一语言模型(LM)。与先前工作不同,MusicGen 由一个单阶段 transformer LM 以及高效的 token 交错模式组成,从而无需级联多个模型(例如分层或上采样)。遵循该方法,我们展示了 MusicGen 如何在以文本描述或旋律特征为条件时生成高质量的 mono 与 stereo 样本,从而更好地控制生成输出。我们进行了广泛的实证评估,包含自动与人工研究,表明所提方法在标准文本到音乐基准上优于所评估的基线。通过消融实验,我们阐明了构成 MusicGen 的各组件的重要性。音乐样本、代码与模型可在 https://github.com/facebookresearch/audiocraft 获取。
引用
@article{arxiv.2306.05284,
title = {Simple and Controllable Music Generation},
author = {Jade Copet and Felix Kreuk and Itai Gat and Tal Remez and David Kant and Gabriel Synnaeve and Yossi Adi and Alexandre Défossez},
journal= {arXiv preprint arXiv:2306.05284},
year = {2024}
}
备注
Published at Neurips 2023