中文

SongBloom:通过交错式自回归草图与扩散精炼生成连贯歌曲

音频与语音处理 2025-10-23 v5 多媒体

摘要

生成具有连贯结构、和谐乐器和人声元素的音乐仍是歌曲生成中的重大挑战。现有的语言模型和基于扩散的方法常常难以在全局连贯性与局部保真度之间取得平衡,导致输出缺乏音乐性或存在不连贯的进程和不匹配的歌词。本文引入SongBloom,一种用于完整歌曲生成的新型框架,利用自回归草图与扩散精炼交错式的范式。SongBloom采用一种结合扩散模型高保真度与语言模型可扩展性的自回归扩散模型。具体而言,它逐步将音乐草图从短尺寸延伸至长尺寸,并从粗粒度细化至细粒度。交错生成范式有效整合了先验语义和声学上下文,以引导生成过程。实验结果表明,SongBloom在主观和客观指标上均优于现有方法,性能与最新的商业音乐生成平台相当。音频样本可在我们的演示页面获取:https://cypress-yang.github.io/SongBloom_demo。代码和模型权重已在https://github.com/Cypress-Yang/SongBloom发布。

关键词

引用

@article{arxiv.2506.07634,
  title  = {SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement},
  author = {Chenyu Yang and Shuai Wang and Hangting Chen and Wei Tan and Jianwei Yu and Haizhou Li},
  journal= {arXiv preprint arXiv:2506.07634},
  year   = {2025}
}

备注

Accepted by NeurIPS2025