中文

StarGAN-VC2:对基于 StarGAN 的语音转换中条件方法的再思考

声音 2019-08-08 v2 机器学习 音频与语音处理 机器学习

摘要

非平行多域语音转换(VC)是一种不依赖平行数据而在多个域之间学习映射的技术。这一点重要但具有挑战性,因为需要学习多个映射且缺乏显式监督。近来,StarGAN-VC 因仅使用单一生成器即可解决该问题而受到关注。然而,真实语音与转换语音之间仍存在差距。为弥补这一差距,我们重新思考 StarGAN-VC 的条件方法——这是在单一模型中实现非平行多域 VC 的关键组件,并提出了一种称为 StarGAN-VC2 的改进变体。具体而言,我们从两个方面重新思考条件方法:训练目标与网络架构。对于前者,我们提出一种源-目标条件对抗损失,使所有源域数据均可转换为目标域数据。对于后者,我们引入一种基于调制的条件方法,能够以特定于域的方式变换声学特征的调制。我们在非平行多说话人 VC 上评估了所提方法。客观评估表明,我们提出的方法在全局与局部结构度量上均改善了语音质量。此外,主观评估显示 StarGAN-VC2 在自然度与说话人相似度方面优于 StarGAN-VC。转换语音样本见 http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/stargan-vc2/index.html。

关键词

引用

@article{arxiv.1907.12279,
  title  = {StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion},
  author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Nobukatsu Hojo},
  journal= {arXiv preprint arXiv:1907.12279},
  year   = {2019}
}

备注

Accepted to Interspeech 2019. Project page: http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/stargan-vc2/index.html