CycleGAN-VC2:改进的基于 CycleGAN 的非并行语音转换
声音
2019-04-10 v1 机器学习
音频与语音处理
机器学习
摘要
非并行语音转换(VC)是一种不依赖并行数据而学习从源语音到目标语音映射的技术。这是一项重要任务,但由于训练条件的局限,一直具有挑战性。近来,CycleGAN-VC 提供了一种突破,在不依赖任何额外数据、模块或时间对齐流程的情况下,取得了与并行 VC 方法相当的性能。然而,真实目标语音与转换语音之间仍存在较大差距,弥合这一差距仍具挑战。为缩小该差距,我们提出 CycleGAN-VC2,它是 CycleGAN-VC 的改进版本,融合了三项新技术:改进的目标函数(两步对抗损失)、改进的生成器(2-1-2D CNN)以及改进的判别器(PatchGAN)。我们在非并行 VC 任务上评估了我们的方法,并详细分析了各项技术的效果。客观评价表明,这些技术有助于在全局与局部结构上使转换特征序列更接近目标,我们分别使用梅尔倒谱失真与调制谱距离进行评估。主观评价表明,CycleGAN-VC2 在每个说话人配对(包括同性别与跨性别配对)的自然度与相似度上均优于 CycleGAN-VC。
引用
@article{arxiv.1904.04631,
title = {CycleGAN-VC2: Improved CycleGAN-based Non-parallel Voice Conversion},
author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Nobukatsu Hojo},
journal= {arXiv preprint arXiv:1904.04631},
year = {2019}
}
备注
Accepted to ICASSP 2019. Project page: http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/cyclegan-vc2/index.html