中文

Everyone-Can-Sing:基于语音参考的零样 sung 声乐合成与转换

声音 2025-01-24 v1 音频与语音处理

摘要

我们提出了一个统一框架,用于歌声合成(SVS)和转换(SVC),以解决现有方法在跨域SVS/SVC、输出音乐性和歌声数据稀缺方面的局限性。我们的框架可控制多个方面,包括基于歌词的语言内容、基于音乐记谱的演奏属性、基于选择器的演唱风格和声部技巧,以及基于语音样本的声音身份。 proposed zero-shot 学习范式包括一个SVS模型和两个SVC模型,利用预训练的内容嵌入和扩散生成器。该框架也训练在由歌声和语音音频组成的混合数据集上,允许基于语音参考进行歌声克隆。实验表明,与最先进的基线方法相比,本框架在 timbre 相似性和音乐性方面取得了显著的改进,为其他低数据音乐任务(如乐器风格迁移)提供了见解。可在:everyone-can-sing.github.io 查看示例。

关键词

引用

@article{arxiv.2501.13870,
  title  = {Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference},
  author = {Shuqi Dai and Yunyun Wang and Roger B. Dannenberg and Zeyu Jin},
  journal= {arXiv preprint arXiv:2501.13870},
  year   = {2025}
}