中文

面向语音到歌声转换的自监督歌声预训练

音频与语音处理 2024-06-05 v1 声音

摘要

语音到歌声转换(STS)任务一直面临数据稀缺的问题,因为它需要配对的语音和歌声数据。此外,内容-音高对齐和生成输出的次优质量也加剧了这一问题,给STS研究带来了重大障碍。本文提出SVPT,一种由自监督歌声预训练模型增强的STS方法。我们利用口语语言模型技术来解决节奏对齐问题,并利用上下文学习能力实现零样本转换。我们采用离散单元随机重采样和音高破坏策略,使得能够使用非配对的歌声数据进行训练,从而缓解数据稀缺问题。SVPT还作为歌声合成(SVS)的有效骨干网络,为扩展SVS模型提供了见解。实验结果表明,SVPT在STS和SVS任务中均带来了显著改进。音频样本可在https://speech2sing.github.io获取。

关键词

引用

@article{arxiv.2406.02429,
  title  = {Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion},
  author = {Ruiqi Li and Rongjie Huang and Yongqi Wang and Zhiqing Hong and Zhou Zhao},
  journal= {arXiv preprint arXiv:2406.02429},
  year   = {2024}
}

备注

13 pages