中文

WaveGlow:一种基于流的语音合成生成网络

声音 2018-11-02 v1 人工智能 机器学习 音频与语音处理 机器学习

摘要

本文提出 WaveGlow:一种能够从梅尔频谱图生成高质量语音的基于流的网络。WaveGlow 结合了 Glow 与 WaveNet 的思想,以提供快速、高效且高质量的音频合成,且无需自回归。WaveGlow 仅使用单一网络实现,仅通过单一损失函数训练:最大化训练数据的似然,这使得训练过程简单且稳定。我们的 PyTorch 实现在 NVIDIA V100 GPU 上以超过 500 kHz 的速率生成音频样本。平均意见得分表明其音频质量与公开可用的最佳 WaveNet 实现相当。所有代码将公开在线提供。

关键词

引用

@article{arxiv.1811.00002,
  title  = {WaveGlow: A Flow-based Generative Network for Speech Synthesis},
  author = {Ryan Prenger and Rafael Valle and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:1811.00002},
  year   = {2018}
}

备注

5 pages, 1 figure, 1 table, 13 equations