中文

多频带 MelGAN:面向高质量文本转语音的更快速波形生成

声音 2020-11-18 v2 音频与语音处理

摘要

本文提出多频带 MelGAN,一种面向高质量文本转语音、速度大幅加快的波形生成模型。具体而言,我们从以下几个方面改进原始的 MelGAN。首先,我们增大了生成器的感受野,这被证明有益于语音生成。其次,我们用多分辨率 STFT 损失替代特征匹配损失,以更好地度量虚假语音与真实语音之间的差异。结合预训练,这一改进带来了更好的音质与更好的训练稳定性。更重要的是,我们通过多频带处理扩展 MelGAN:生成器以梅尔谱图为输入,产生子带信号,随后求和回全带信号作为判别器输入。所提出的多频带 MelGAN 在波形生成和 TTS 中分别取得了 4.34 和 4.22 的高 MOS。凭借仅 1.91M 参数,我们的模型将原始 MelGAN 的总计算复杂度由 5.85 GFLOPS 有效降至 0.95 GFLOPS。我们的 Pytorch 实现(将很快开源)在无硬件特定优化的情况下于 CPU 上可达到 0.03 的实时因子。

关键词

引用

@article{arxiv.2005.05106,
  title  = {Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech},
  author = {Geng Yang and Shan Yang and Kai Liu and Peng Fang and Wei Chen and Lei Xie},
  journal= {arXiv preprint arXiv:2005.05106},
  year   = {2020}
}

备注

Submitted to Interspeech2020