中文

用对比判别器提升Star-GAN用于语音转换

音频与语音处理 2022-09-28 v4 人工智能 机器学习 声音

摘要

非平行多域语音转换方法如StarGAN-VCs已广泛应用于诸多场景。然而,由于其复杂的对抗网络结构,这些模型的训练通常面临挑战。为此,本工作利用最先进的对比学习技术,并将高效的孪生网络结构引入StarGAN判别器。我们的方法称为SimSiam-StarGAN-VC,它提升了训练稳定性并有效防止了训练过程中判别器过拟合问题。我们在Voice Conversion Challenge(VCC 2018)数据集上开展实验,并辅以用户研究来验证我们框架的性能。实验结果表明,SimSiam-StarGAN-VC在客观和主观指标上均显著优于现有StarGAN-VC方法。

关键词

引用

@article{arxiv.2209.10088,
  title  = {Boosting Star-GANs for Voice Conversion with Contrastive Discriminator},
  author = {Shijing Si and Jianzong Wang and Xulong Zhang and Xiaoyang Qu and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2209.10088},
  year   = {2022}
}

备注

12 pages, 3 figures, Accepted by ICONIP 2022