中文

基于提示控制的多任务歌曲生成通用框架

音频与语音处理 2026-02-17 v5 计算与语言 声音

摘要

歌曲生成旨在基于各种提示生成可控的高质量歌曲。然而,现有方法在基于提示控制生成人声和伴奏并确保二者对齐方面存在挑战,同时也不足以支持多种任务。为此,我们提出了 VersBand,一个用于合成高质量、可控且对齐歌曲的多任务歌曲生成框架。VersBand 包含以下主要模型:1)VocalBand,一个解耦模型,利用流匹配方法生成演唱风格、音高和 mel-spectrogram,实现快速高质量的人声生成并支持风格控制。2)AccompBand,基于流变压器的模型,集成 Band-MOE,通过选择合适的专家提升质量、对齐度和控制能力。该模型可生成与人声对齐的可控高质量伴奏。3)两个生成模型,LyricBand 用于生成歌词,MelodyBand 用于生成旋律,构成完整的多任务歌曲生成系统,支持基于多个提示的广泛控制。实验结果表明,VersBand 在多个歌曲生成任务中超越基线模型,采用客观和主观指标进行评估。演示和代码均可在 https://aaronz345.github.io/VersBandDemo 和 https://github.com/AaronZ345/VersBand 提供。

关键词

引用

@article{arxiv.2504.19062,
  title  = {Versatile Framework for Song Generation with Prompt-based Control},
  author = {Yu Zhang and Wenxiang Guo and Changhao Pan and Zhiyuan Zhu and Ruiqi Li and Jingyu Lu and Rongjie Huang and Ruiyuan Zhang and Zhiqing Hong and Ziyue Jiang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2504.19062},
  year   = {2026}
}

备注

Accepted by Findings of EMNLP 2025