用对比判别器提升Star-GAN用于语音转换
音频与语音处理
2022-09-28 v4 人工智能
机器学习
声音
摘要
非平行多域语音转换方法如StarGAN-VCs已广泛应用于诸多场景。然而,由于其复杂的对抗网络结构,这些模型的训练通常面临挑战。为此,本工作利用最先进的对比学习技术,并将高效的孪生网络结构引入StarGAN判别器。我们的方法称为SimSiam-StarGAN-VC,它提升了训练稳定性并有效防止了训练过程中判别器过拟合问题。我们在Voice Conversion Challenge(VCC 2018)数据集上开展实验,并辅以用户研究来验证我们框架的性能。实验结果表明,SimSiam-StarGAN-VC在客观和主观指标上均显著优于现有StarGAN-VC方法。
引用
@article{arxiv.2209.10088,
title = {Boosting Star-GANs for Voice Conversion with Contrastive Discriminator},
author = {Shijing Si and Jianzong Wang and Xulong Zhang and Xiaoyang Qu and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2209.10088},
year = {2022}
}
备注
12 pages, 3 figures, Accepted by ICONIP 2022