中文

LaDA-Band:面向人声到伴奏生成的离散语言扩散模型

声音 2026-04-14 v1

摘要

人声到伴奏(V2A)生成旨在将原始人声录音转换为完整编排的伴奤,本质上需要同时解决三个编奏三难题:保持声学真实性、与人声轨道保持全局一致性、在整首歌曲中实现动态编排。现有开源方法通常在上述目标之间做出妥协。连续潜在生成模型能够捕获长时段音乐结构,但常难以保持细粒度的声学细节。相比之下,离散自回归模型保留了局部保真度,但受限于单向生成和在扩展上下文中的误差累积。我们提出 LaDA-Band,一个端到端框架,引入离散掩码扩散模型至 V2A 任务。我们的方法将 V2A 生成形式化为离散掩码扩散,即一种全局、非自回归的去噪 formulation,将离散音频编解码器 token 的表征优势与完整序列双向上下文建模相结合。该设计提高了长期结构一致性和时间同步性,同时保持清晰的声学细节。基于此 framework,LaDA-Band 进一步引入双轨前缀条件 architecture、辅助被替换 token 检测目标用于弱锚定伴奤区域,以及两阶段渐进式 curriculum 以将离散掩码扩散扩展至整首歌曲的人声到伴奤生成。广泛的实验在学术和真实世界基准上表明,LaDA-Band 在保持声学真实性、全局一致性和动态编排方面持续优于现有基线,同时在无需额外参考音频的情况下仍保持强性能。代码与音频样例已提供于 https://github.com/Duoluoluos/TME-LaDA-Band。

关键词

引用

@article{arxiv.2604.11052,
  title  = {LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation},
  author = {Qi Wang and Zhexu Shen and Meng Chen and Guoxin Yu and Chaoxu Pang and Weifeng Zhao and Wenjiang Zhou},
  journal= {arXiv preprint arXiv:2604.11052},
  year   = {2026}
}

备注

Submitted to ACMMM 2026. Under review