DiffRhythm 2:基于块流匹配的高效高保真歌曲生成
音频与语音处理
2026-02-04 v3
摘要
生成完整时长的高质量歌曲具有挑战性,因为需要在文本与音乐模态之间以及音乐模态内部维持长期一致性。现有非自回归(NAR)框架虽能生成高质量歌曲,却在歌词与声乐对齐方面存在困难。同时,满足多样化的音乐偏好需求需要引入人类反馈强化学习(RLHF),但现有方法常通过合并多个模型实现多偏好优化,导致显著性能下降。为此,本文提出 DiffRhythm 2,一个面向高保真可控歌曲生成的端到端框架。为解决歌词对齐问题,DiffRhythm 2 采用基于块流匹配的半自回归架构,无需外部标签与约束即可实现歌词与演唱声乐的精准对齐,同时保持 NAR 模型的高生成质量与效率。为支撑长序列计算,可实现帧率为 5Hz 的音乐变分自编码器(VAE),仍能实现高保真音频重构。此外,为克服 RLHF 中多偏好优化的局限,本文提出交叉对偏好优化方法,有效缓解模型合并常导致的性能下降,使框架能在多样化人类偏好下保持稳健优化。进一步通过引入随机块表示对齐损失,提升音乐性与结构一致性。
引用
@article{arxiv.2510.22950,
title = {DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching},
author = {Yuepeng Jiang and Huakang Chen and Ziqian Ning and Jixun Yao and Zerui Han and Di Wu and Meng Meng and Jian Luan and Zhonghua Fu and Lei Xie},
journal= {arXiv preprint arXiv:2510.22950},
year = {2026}
}