LeVo:具有多偏好对齐的高质量歌曲生成
声音
2025-10-24 v3 人工智能
音频与语音处理
摘要
大语言模型(LLM)和音频语言模型的最新进展显著改善了音乐生成,尤其是在歌词到歌曲生成方面。然而,现有方法仍然难以应对歌曲的复杂构成和高质量数据的稀缺性,导致在音频质量、音乐性、指令遵循以及人声与伴奏和谐度方面存在局限。为应对这些挑战,我们提出了LeVo,一个基于语言模型的框架,由LeLM和音乐编解码器组成。LeLM能够并行建模两种类型的token:混合token,表示人声和伴奏的组合音频,以实现更好的人声与伴奏和谐度;以及双轨token,分别编码人声和伴奏,以实现高质量歌曲生成。它采用两个仅解码器的Transformer和一个模块化扩展训练策略,以防止不同token类型之间的干扰。为进一步增强音乐性和指令遵循能力,我们引入了一种基于直接偏好优化(DPO)的多偏好对齐方法。该方法通过半自动数据构建流程和后训练来处理多样化的人类偏好。实验结果表明,LeVo在客观和主观指标上均显著优于现有的开源方法,同时与工业系统相比具有竞争力。消融研究进一步证明了我们设计的有效性。音频示例和源代码可在https://levo-demo.github.io 和 https://github.com/tencent-ailab/songgeneration获取。
引用
@article{arxiv.2506.07520,
title = {LeVo: High-Quality Song Generation with Multi-Preference Alignment},
author = {Shun Lei and Yaoxun Xu and Zhiwei Lin and Huaicheng Zhang and Wei Tan and Hangting Chen and Jianwei Yu and Yixuan Zhang and Chenyu Yang and Haina Zhu and Shuai Wang and Zhiyong Wu and Dong Yu},
journal= {arXiv preprint arXiv:2506.07520},
year = {2025}
}
备注
Accepted by NeurIPS 2025