中文

支持训练集外说话人的多对多语音转换

音频与语音处理 2019-05-08 v1 计算与语言 声音

摘要

我们提出了一种基于 Cycle-GAN 的多对多语音转换方法,能够转换训练集中不存在的说话人之间的语音。这一特性通过由神经网络生成的说话人嵌入实现,该神经网络与 Cycle-GAN 联合训练。与本领域先前工作不同,我们的方法支持训练集外说话人与目标说话人之间任意方向的转换,且无需重新训练。我们使用独立训练的说话人识别模型评估训练集外说话人的转换质量,结果表明对未听过说话人的风格转换具有良好的特性。对人工听者的主观测试表明,训练集内说话人的风格转换质量与最先进的基线模型相当。

关键词

引用

@article{arxiv.1905.02525,
  title  = {Many-to-Many Voice Conversion with Out-of-Dataset Speaker Support},
  author = {Gokce Keskin and Tyler Lee and Cory Stephenson and Oguz H. Elibol},
  journal= {arXiv preprint arXiv:1905.02525},
  year   = {2019}
}

备注

Submitted to Interspeech 2019