StarGAN-VC:基于星型生成对抗网络的非平行多对多语音转换
声音
2018-07-02 v2 机器学习
音频与语音处理
机器学习
摘要
本文提出了一种利用名为 StarGAN 的生成对抗网络(GAN)变体来实现非平行多对多语音转换(VC)的方法。我们将该方法称为 StarGAN-VC,其显著之处在于:(1) 在语音生成器训练中不需要平行话语、转录或时间对齐过程;(2) 使用单一生成器网络同时学习跨不同属性域的多对多映射;(3) 能够足够快地生成转换后的语音信号以支持实时实现;(4) 仅需数分钟的训练样本即可生成听起来相当逼真的语音。在非平行多对多说话人身份转换任务上的主观评估实验表明,与基于变分自编码器 GAN 的 SOTA 方法相比,所提出的方法获得了更高的音质和说话人相似度。
引用
@article{arxiv.1806.02169,
title = {StarGAN-VC: Non-parallel many-to-many voice conversion with star generative adversarial networks},
author = {Hirokazu Kameoka and Takuhiro Kaneko and Kou Tanaka and Nobukatsu Hojo},
journal= {arXiv preprint arXiv:1806.02169},
year = {2018}
}