中文

Muse:面向可再现长篇歌曲生成的细粒度风格控制

声音 2026-01-13 v3 计算与语言

摘要

近期商业系统如 Suno 在长篇歌曲生成方面展现出强大的能力,而学术界的研究因缺乏公开可用的训练数据而在可重复性方面仍显不足。这一工作发布了一个完全开源的长篇歌曲生成系统,支持细粒度风格控制,包括经授权的合成数据集、训练与评估管线,以及名为 Muse 的易于部署的歌曲生成模型。该数据集由 116k 首经授权的合成歌曲组成,包含自动生成的歌词和风格描述,并由 SunoV5 合成的音频配对。我们通过对基于 Qwen 的语言模型进行单阶段监督微调,模型扩展了离散音频标记并采用 MuCodec 实现,无需任务特定损失、辅助目标或额外架构组件。我们的评估表明,尽管 Muse 的数据规模和模型规模相对有限,但在音素错误率、文本-音乐风格相似性和音频审美质量方面已达到具竞争力的性能,并能在不同音乐结构下实现可控的片段级生成。所有数据、模型权重以及训练与评估管线将公开释放,为可控长篇歌曲生成研究的持续进步铺平道路。项目仓库地址为 https://github.com/yuhui1038/Muse。

关键词

引用

@article{arxiv.2601.03973,
  title  = {Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control},
  author = {Changhao Jiang and Jiahao Chen and Zhenghao Xiang and Zhixiong Yang and Hanchen Wang and Jiabao Zhuang and Xinmeng Che and Jiajun Sun and Hui Li and Yifei Cao and Shihan Dou and Ming Zhang and Junjie Ye and Tao Ji and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2601.03973},
  year   = {2026}
}