YuE:面向长篇幅音乐生成的开源基础模型扩展
音频与语音处理
2025-09-16 v2 人工智能
多媒体
声音
摘要
我们通过引入YuE——一个基于LLaMA2架构的开源基础模型系列——来解决长篇幅音乐生成任务,特别是具有挑战性的歌词到歌曲问题。具体而言,YuE扩展至数万亿个token,能够生成长达五分钟的音乐,同时保持歌词对齐、连贯的音乐结构和具有适当伴奏的引人入胜的歌声旋律。它通过(1)轨道解耦的下一token预测来克服密集混合信号,(2)用于长上下文歌词对齐的结构化渐进条件化,以及(3)多任务、多阶段预训练方案来实现收敛和泛化。此外,我们重新设计了音乐生成的上下文学习技术,使其能够实现多样化的风格迁移(例如,将日本城市流行音乐转换为英语说唱,同时保留原始伴奏)和双向生成。通过广泛的评估,我们证明YuE在音乐性和歌声灵活性方面匹配甚至超越了一些专有系统。此外,对YuE进行微调可以实现额外的控制并增强对小语种的支持。此外,除了生成之外,我们还表明YuE学到的表示在音乐理解任务上表现良好,其中YuE的结果在MARBLE基准测试上匹配或超越了最先进的方法。
引用
@article{arxiv.2503.08638,
title = {YuE: Scaling Open Foundation Models for Long-Form Music Generation},
author = {Ruibin Yuan and Hanfeng Lin and Shuyue Guo and Ge Zhang and Jiahao Pan and Yongyi Zang and Haohe Liu and Yiming Liang and Wenye Ma and Xingjian Du and Xinrun Du and Zhen Ye and Tianyu Zheng and Zhengxuan Jiang and Yinghao Ma and Minghao Liu and Zeyue Tian and Ziya Zhou and Liumeng Xue and Xingwei Qu and Yizhi Li and Shangda Wu and Tianhao Shen and Ziyang Ma and Jun Zhan and Chunhui Wang and Yatian Wang and Xiaowei Chi and Xinyue Zhang and Zhenzhu Yang and Xiangzhou Wang and Shansong Liu and Lingrui Mei and Peng Li and Junjie Wang and Jianwei Yu and Guojian Pang and Xu Li and Zihao Wang and Xiaohuan Zhou and Lijun Yu and Emmanouil Benetos and Yong Chen and Chenghua Lin and Xie Chen and Gus Xia and Zhaoxiang Zhang and Chao Zhang and Wenhu Chen and Xinyu Zhou and Xipeng Qiu and Roger Dannenberg and Jiaheng Liu and Jian Yang and Wenhao Huang and Wei Xue and Xu Tan and Yike Guo},
journal= {arXiv preprint arXiv:2503.08638},
year = {2025}
}
备注
https://github.com/multimodal-art-projection/YuE