中文

基于增强分类器星型生成对抗网络的非并行语音转换

音频与语音处理 2020-11-11 v7 机器学习

摘要

我们此前提出了一种利用称为 StarGAN 的生成对抗网络(GAN)变体实现非并行语音转换(VC)的方法。我们该方法(称为 StarGAN-VC)的主要特点如下:首先,其训练语音生成器无需平行语句、转写文本或时间对齐过程。其次,它可使用单一生成器网络同时学习多域间的映射,从而充分利用从多域收集的训练数据来捕捉所有域共有的潜在特征。第三,它生成转换后的语音信号足够快,可支持实时实现,且仅需几分钟的训练样本即可生成相当逼真的语音。本文中,我们描述了 StarGAN 的三种表述,包括一种新引入的称为“增强分类器星型 GAN(A-StarGAN)”的 StarGAN 变体,并在非并行 VC 任务中对它们进行比较。我们还将其与若干基线方法进行比较。

关键词

引用

@article{arxiv.2008.12604,
  title  = {Nonparallel Voice Conversion with Augmented Classifier Star Generative Adversarial Networks},
  author = {Hirokazu Kameoka and Takuhiro Kaneko and Kou Tanaka and Nobukatsu Hojo},
  journal= {arXiv preprint arXiv:2008.12604},
  year   = {2020}
}

备注

Submitted to IEEE/ACM Trans. ASLP. This paper is an extended full-paper version of arXiv:1806.02169