MusicGen-Stem:通过自回归建模进行多轨音乐生成与编辑
声音
2025-01-08 v2 音频与语音处理
摘要
虽然大多数音乐生成模型生成混合轨(单声道或立体声),但我们提出训练一个具有 3 条轨道(低音、鼓组和其他)的多轨生成模型,学习它们之间的音乐依赖性。为此,我们为每条轨道训练一个专用的压缩算法,将音乐分词为平行的 token 流。然后, 我们利用近期在音源分离任务中的改进, 在大型数据集上训练一个多流文本到音乐语言模型。最后, 由于一种特殊的条件方法,我们的模型能够在现有或生成的歌曲上编辑低音、鼓组或其他轨道,以及进行迭代创作(例如在现有鼓组上生成低音)。这为音乐生成算法提供了更大的灵活性,并且据我们所知,这是首个能够实现良好质量生成和连贯音源编辑的开源多轨自回归音乐生成模型。代码和模型权重将发布,样本可在 https://simonrouard.github.io/musicgenstem/ 上获取。
引用
@article{arxiv.2501.01757,
title = {MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling},
author = {Simon Rouard and Robin San Roman and Yossi Adi and Axel Roebel},
journal= {arXiv preprint arXiv:2501.01757},
year = {2025}
}
备注
5 pages, 3 figures, accepted to ICASSP 2025