中文

WG-WaveNet:无需GPU的实时高保真语音合成

音频与语音处理 2020-08-21 v3 声音

摘要

在本文中,我们提出WG-WaveNet,一种快速、轻量且高质量的波形生成模型。WG-WaveNet由一个紧凑的基于流的模型和一个后滤波器组成。这两个组件通过最大化训练数据的似然以及在频域上优化损失函数进行联合训练。由于我们设计了一个高度压缩的基于流的模型,所提出的模型在训练和推理阶段相比其他波形生成模型需要少得多的计算资源;即使模型被高度压缩,后滤波器仍保持了生成波形的质量。我们的PyTorch实现可以使用少于8 GB的GPU内存进行训练,并在NVIDIA 1080Ti GPU上以超过960 kHz的速率生成音频样本。此外,即使在CPU上合成,我们表明所提出的方法能够以比实时快1.2倍的速度生成44.1 kHz的语音波形。实验还表明,生成音频的质量与其他方法相当。音频样本已在线公开。

关键词

引用

@article{arxiv.2005.07412,
  title  = {WG-WaveNet: Real-Time High-Fidelity Speech Synthesis without GPU},
  author = {Po-chun Hsu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2005.07412},
  year   = {2020}
}

备注

INTERSPEECH 2020