StarGANv2-VC:一个多样化、无监督、非平行的自然 sounding 语音转换框架
声音
2021-07-26 v2 机器学习
音频与语音处理
摘要
我们提出一种使用称为 StarGAN v2 的生成对抗网络(GAN)的无监督非平行多对多语音转换(VC)方法。通过结合对抗源分类器损失与感知损失,我们的模型显著优于以往的 VC 模型。尽管我们的模型仅以 20 位英语说话人训练,它可泛化至多种语音转换任务,如任意到多、跨语言及歌唱转换。利用风格编码器,我们的框架还可将平读语音转换为风格化语音,如情感与假声语音。在非平行多对多语音转换任务上的主观与客观评测实验表明,我们的模型生成自然 sounding 的语音,在音质上接近最先进的基于文本转语音(TTS)的语音转换方法,且无需文本标签。此外,我们的模型完全卷积化,配合快于实时的声码器(如 Parallel WaveGAN)可实现实时语音转换。
引用
@article{arxiv.2107.10394,
title = {StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion},
author = {Yinghao Aaron Li and Ali Zare and Nima Mesgarani},
journal= {arXiv preprint arXiv:2107.10394},
year = {2021}
}
备注
INTERSPEECH 2021