使用循环一致对抗网络的无需平行数据的语音转换
机器学习
2017-12-21 v2 声音
音频与语音处理
摘要
我们提出一种无需平行数据的语音转换(VC)方法,该方法可在不依赖平行数据的情况下学习从源语音到目标语音的映射。所提方法为通用、高质量且无需平行数据,无需任何额外数据、模块或对齐过程即可工作。它还避免了在许多传统基于统计模型的 VC 方法中出现的过平滑现象。我们的方法称为 CycleGAN-VC,使用带有门控卷积神经网络(CNNs)与恒等映射损失的循环一致对抗网络(CycleGAN)。CycleGAN 利用对抗损失与循环一致性损失同时学习前向与反向映射。这使得从未配对数据中找到最优伪配对成为可能。此外,对抗损失有助于减少转换后特征序列的过平滑。我们配置带有门控 CNNs 的 CycleGAN 并以恒等映射损失训练它。这使得映射函数能够捕获序列与层次结构,同时保留语言信息。我们在无需平行数据的 VC 任务上评估了我们的方法。客观评价显示,转换后的特征序列在全局方差与调制谱方面接近自然语音。主观评价显示,在拥有平行数据且数据量两倍的有利条件下,转换语音的质量与基于高斯混合模型的方法相当。
引用
@article{arxiv.1711.11293,
title = {Parallel-Data-Free Voice Conversion Using Cycle-Consistent Adversarial Networks},
author = {Takuhiro Kaneko and Hirokazu Kameoka},
journal= {arXiv preprint arXiv:1711.11293},
year = {2017}
}