中文

TFGAN:基于时域与频域的生成对抗网络用于高保真语音合成

音频与语音处理 2020-11-25 v1

摘要

近来,基于 GAN 的语音合成方法(如 MelGAN)已变得非常流行。相较于传统的基于自回归的方法,基于并行结构的生成器使波形生成过程快速且稳定。然而,基于自回归的神经声码器(如 WaveRNN)所生成语音的质量仍高于 GAN。为解决此问题,我们提出一种新颖的声码器模型:TFGAN,其在时域与频域均通过对抗学习进行训练。一方面,我们提出在频域判别真实波形与合成波形,以提供更多一致性保证,而非仅在时域进行。另一方面,与常规的频域 STFT 损失方法或通过判别器特征图损失来学习波形的做法不同,我们提出一组时域损失,以鼓励生成器直接捕捉波形。TFGAN 具有与 MelGAN 近乎相同的合成速度,但我们的新颖学习方法显著提升了保真度。在我们的实验中,TFGAN 展现出在语音合成场景下取得与自回归声码器可比较的平均意见得分(MOS)的能力。

关键词

引用

@article{arxiv.2011.12206,
  title  = {TFGAN: Time and Frequency Domain Based Generative Adversarial Network for High-fidelity Speech Synthesis},
  author = {Qiao Tian and Yi Chen and Zewang Zhang and Heng Lu and Linghui Chen and Lei Xie and Shan Liu},
  journal= {arXiv preprint arXiv:2011.12206},
  year   = {2020}
}