中文

Drop the beat! 基于伴奏条件的说唱语音生成系统 Freestyler

音频与语音处理 2024-08-29 v1 声音

摘要

说唱是一种主导性的声乐表演类型,在声音生成领域仍鲜有探索。一般语音合成依赖于精确的音符和时长输入,需要用户具有相关音乐知识,这限制了灵活性。相比之下,说唱通常具有较简单的旋律,核心关注点是与伴奏和谐的强烈节奏感。在本论文中,我们提出了 Freestyler,这是第一个从歌词和伴奏输入直接生成说唱声音的系统。Freestyler 利用基于语言模型的标记生成,随后采用条件流匹配模型生成频谱图,并通过神经声码器恢复音频。它允许使用 3 秒提示实现零样本声纹控制。由于公开可得的说唱数据集稀缺,我们还收集了来自互联网的 RapBank 说唱歌曲数据集,并设计了严密的处理管道。实验结果表明,Freestyler 能够产生高质量的说唱语音生成,具有增强的自然性和与伴奏在风格和节奏上的强强对齐。

关键词

引用

@article{arxiv.2408.15474,
  title  = {Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation},
  author = {Ziqian Ning and Shuai Wang and Yuepeng Jiang and Jixun Yao and Lei He and Shifeng Pan and Jie Ding and Lei Xie},
  journal= {arXiv preprint arXiv:2408.15474},
  year   = {2024}
}