中文

SongEditor:将零样本歌曲生成语言模型适配为多任务编辑器

音频与语音处理 2025-01-29 v2 声音

摘要

新型生成建模范式的出现,特别是音频语言模型,显著推动了歌曲生成领域的发展。尽管最先进的模型能够同时合成长达数分钟的人声和伴奏音轨,但关于现有歌曲局部调整或编辑的研究仍处于探索不足的阶段,而这能带来更灵活、更有效的制作。在本文中,我们提出了 SongEditor,这是首个将编辑能力引入语言模型化歌曲生成方法的歌曲编辑范式,可促进分段和分轨修改。SongEditor 提供了调整歌词、人声和伴奏的灵活性,以及从零开始合成歌曲的能力。SongEditor 的核心组件包括音乐分词器、自回归语言模型和扩散生成器,能够生成整段音乐、掩蔽歌词,甚至是分离的人声和背景音乐。大量实验表明,所提出的 SongEditor 在端到端歌曲编辑方面取得了卓越性能,客观和主观指标均证实了这一点。音频样本可在 https://cypress-yang.github.io/SongEditor_demo/ 获取。

关键词

引用

@article{arxiv.2412.13786,
  title  = {SongEditor: Adapting Zero-Shot Song Generation Language Model as a Multi-Task Editor},
  author = {Chenyu Yang and Shuai Wang and Hangting Chen and Jianwei Yu and Wei Tan and Rongzhi Gu and Yaoxun Xu and Yizhi Zhou and Haina Zhu and Haizhou Li},
  journal= {arXiv preprint arXiv:2412.13786},
  year   = {2025}
}

备注

Accepted by AAAI2025