中文

GAZEV:基于 GAN 的非平行语音语料零样本语音转换

声音 2020-10-27 v1 音频与语音处理

摘要

非平行多对多语音转换近来在语音处理领域吸引了大量研究投入。语音转换系统通过将源说话人话语的内容保留、并以目标说话人的声学特征替换,从而将源说话人话语转换为目标说话人的另一话语。现有方案(如 StarGAN-VC2)仅在模型训练时可使用相关说话人语音语料的情况下才取得令人满意的结果。AUTOVC 能够对未见说话人执行语音转换,但其需要一个外部预训练的说话人验证模型。本文提出一种新的基于 GAN 的零样本语音转换方案,称为 GAZEV,旨在支持源与目标话语均为未见说话人的情形。我们的关键技术贡献是在 GAN 框架之上引入说话人嵌入损失以及自适应实例归一化策略,以解决现有方案在说话人身份迁移上的局限。我们的实证评估表明,在输出语音质量上取得了显著性能提升,且与 AUTOVC 具有可比的说话人相似度。

关键词

引用

@article{arxiv.2010.12788,
  title  = {GAZEV: GAN-Based Zero-Shot Voice Conversion over Non-parallel Speech Corpus},
  author = {Zining Zhang and Bingsheng He and Zhenjie Zhang},
  journal= {arXiv preprint arXiv:2010.12788},
  year   = {2020}
}