中文

基于完全文本控制旋律的伴唱人声合成

音频与语音处理 2024-07-03 v1 计算与语言 声音

摘要

文本到歌曲(TTSong)是一种合成伴随人声的音乐生成任务。当前TTSong方法继承自人声合成(SVS),需要旋律相关信息,而此类信息有时并不实用,例如音乐谱分或MIDI序列。我们提出MelodyLM,这是第一个能够生成高质量歌曲作品的TTSong模型,实现完全文本控制旋律,用户需求最小且控制灵活性最高。MelodyLM显式地将MIDI建模为中间旋律相关特征,并以语言模型方式在文本和人声提示条件下依次生成人声轨道。随后,通过采用混合条件进行时间对齐,伴奏音乐由潜在扩散模型合成。用户只需输入歌词和参考人声即可合成歌曲样本,实现最小化要求;若需完全控制,只需输入文本提示甚至直接输入MIDI。实验结果表明,MelodyLM在客观和主观指标上均实现了优异的性能。音频样本可在https://melodylm666.github.io查看。

关键词

引用

@article{arxiv.2407.02049,
  title  = {Accompanied Singing Voice Synthesis with Fully Text-controlled Melody},
  author = {Ruiqi Li and Zhiqing Hong and Yongqi Wang and Lichao Zhang and Rongjie Huang and Siqi Zheng and Zhou Zhao},
  journal= {arXiv preprint arXiv:2407.02049},
  year   = {2024}
}

备注

Working in progress