中文

VocGAN:一种基于分层嵌套对抗网络的高保真实时声码器

音频与语音处理 2020-07-31 v1 机器学习 声音 信号处理

摘要

我们提出一种名为 VocGAN 的新型高保真实时神经声码器。近期开发的基于 GAN 的声码器 MelGAN 可实时生成语音波形。然而,它常生成质量不足或与输入梅尔频谱图声学特征不一致的波形。VocGAN 速度与 MelGAN 近乎相同,但显著改善了输出波形的质量与一致性。VocGAN 应用多尺度波形生成器与分层嵌套判别器,以均衡方式学习多层级声学属性。它还应用联合条件与非条件目标,该目标在高分辨率图像合成中已显示成功结果。实验中,VocGAN 在 GTX 1080Ti GPU 上合成语音波形的速度比实时快 416.7 倍,在 CPU 上快 3.24 倍。与 MelGAN 相比,它在包括平均意见得分(MOS)在内的多项评估指标上以极小额外开销展现出显著改善的质量。此外,与另一近期开发的高保真声码器 Parallel WaveGAN 相比,VocGAN 在 CPU 上快 6.98 倍且表现出更高的 MOS。

关键词

引用

@article{arxiv.2007.15256,
  title  = {VocGAN: A High-Fidelity Real-time Vocoder with a Hierarchically-nested Adversarial Network},
  author = {Jinhyeok Yang and Junmo Lee and Youngik Kim and Hoonyoung Cho and Injung Kim},
  journal= {arXiv preprint arXiv:2007.15256},
  year   = {2020}
}

备注

Accepted to INTERSPEECH 2020