DiffRhythm:基于潜在扩散的高速端到端全曲长度歌曲生成
音频与语音处理
2025-03-04 v1
摘要
近期音乐生成技术取得了显著进展,但现有方法仍面临关键局限。部分生成模型仅能合成人声轨道或伴奏轨道。而能够生成人声与伴奏组合音频的模型,通常依赖精心设计的多阶段级联架构和复杂的数据管道,限制了其可扩展性。此外,大多数系统仅能生成短时段音乐。广泛使用的语言模型方法推理速度较慢。为此,我们提出 DiffRhythm,首个基于潜在扩散的歌曲生成模型,能够在十秒内生成时长最高达4分51秒的完整歌曲,同时保持高音乐性和可理解性。尽管具备卓越能力,DiffRhythm 设计简洁优雅:无需复杂数据预处理,采用简单模型结构,仅需歌词和风格提示即可完成推理。此外,其非自回归结构确保了快速推理速度。这一简单性保证了 DiffRhythm 的可扩展性。我们还发布了完整的训练代码及在大规模数据上预训练的模型,以促进可重复性和进一步研究。
引用
@article{arxiv.2503.01183,
title = {DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion},
author = {Ziqian Ning and Huakang Chen and Yuepeng Jiang and Chunbo Hao and Guobin Ma and Shuai Wang and Jixun Yao and Lei Xie},
journal= {arXiv preprint arXiv:2503.01183},
year = {2025}
}