SongGen:用于文本到歌曲生成的单阶段自回归Transformer
声音
2025-06-02 v2 人工智能
摘要
文本到歌曲生成是一种从文本输入创建人声和伴奏的任务,由于领域复杂性和数据稀缺性,面临着显著挑战。现有方法通常采用多阶段生成程序,导致训练和推理管道笨拙,以及由于跨阶段误差积累导致整体生成质量次优。在本文中,我们提出了SongGen,这是一个全新开源的单阶段自回归Transformer,专为可控歌曲生成设计。该模型支持对多样化音乐属性进行细粒度控制,包括歌词和对乐器、风格、情绪和音色的文本描述,同时提供可选的三秒参考片段用于语音克隆。在统一的自回归框架内,SongGen支持两种输出模式:混合模式,可直接生成人声和伴奏的混合声;双轨模式,可分别合成人声和伴奏,以适应下游应用。我们探索了每种模式的多样化token模式策略,取得显著改进并积累了宝贵见解。此外,我们设计了一个自动化数据预处理管道,具备有效质量控制。为促进社区参与和未来研究,我们将公开发布模型权重、训练代码、标注数据和预处理管道。代码可在https://github.com/LiuZH-19/SongGen 获取。
关键词
引用
@article{arxiv.2502.13128,
title = {SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation},
author = {Zihan Liu and Shuangrui Ding and Zhixiong Zhang and Xiaoyi Dong and Pan Zhang and Yuhang Zang and Yuhang Cao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2502.13128},
year = {2025}
}