中文

利用实例归一化分离说话人与内容表征的 One-shot 语音转换

机器学习 2019-08-23 v4 声音 音频与语音处理 机器学习

摘要

最近,无并行数据的语音转换已成功适应多目标场景,在该场景中训练单个模型将输入语音转换为许多不同说话人的语音。然而,此类模型受到限制,只能将语音转换为训练数据中的说话人,这缩小了 VC 的适用场景。在本文中,我们提出了一种新颖的 one-shot VC 方法,该方法仅需源说话人和目标说话人各一句示例话语即可执行 VC,且源说话人和目标说话人甚至不需要在训练期间被见过。这是通过利用实例归一化(IN)解耦说话人与内容表征来实现的。客观和主观评估表明,我们的模型能够生成与目标说话人相似的语音。除了性能测量之外,我们还证明了该模型能够在没有任何监督的情况下学习有意义的说话人表征。

关键词

引用

@article{arxiv.1904.05742,
  title  = {One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization},
  author = {Ju-chieh Chou and Cheng-chieh Yeh and Hung-yi Lee},
  journal= {arXiv preprint arXiv:1904.05742},
  year   = {2019}
}

备注

Interspeech 2019