WaveGlow:一种基于流的语音合成生成网络
声音
2018-11-02 v1 人工智能
机器学习
音频与语音处理
机器学习
摘要
本文提出 WaveGlow:一种能够从梅尔频谱图生成高质量语音的基于流的网络。WaveGlow 结合了 Glow 与 WaveNet 的思想,以提供快速、高效且高质量的音频合成,且无需自回归。WaveGlow 仅使用单一网络实现,仅通过单一损失函数训练:最大化训练数据的似然,这使得训练过程简单且稳定。我们的 PyTorch 实现在 NVIDIA V100 GPU 上以超过 500 kHz 的速率生成音频样本。平均意见得分表明其音频质量与公开可用的最佳 WaveNet 实现相当。所有代码将公开在线提供。
引用
@article{arxiv.1811.00002,
title = {WaveGlow: A Flow-based Generative Network for Speech Synthesis},
author = {Ryan Prenger and Rafael Valle and Bryan Catanzaro},
journal= {arXiv preprint arXiv:1811.00002},
year = {2018}
}
备注
5 pages, 1 figure, 1 table, 13 equations