中文

Parallel WaveNet:快速高保真语音合成

机器学习 2017-11-29 v1

摘要

近年来提出的 WaveNet 架构是现实语音合成领域的当前最优方法,对于多种不同语言,其自然度评分始终高于以往任何系统。然而,由于 WaveNet 依赖于一次顺序生成一个音频样本,它难以适应当今的大规模并行计算机,因此很难部署到实时生产环境中。本文提出概率密度蒸馏(Probability Density Distillation),一种从已训练 WaveNet 训练并行前馈网络的新方法,且质量无显著差异。所得系统能够以超过实时 20 倍的速度生成高保真语音样本,并已由 Google Assistant 在线部署,包括提供多种英语和日语语音。

关键词

引用

@article{arxiv.1711.10433,
  title  = {Parallel WaveNet: Fast High-Fidelity Speech Synthesis},
  author = {Aaron van den Oord and Yazhe Li and Igor Babuschkin and Karen Simonyan and Oriol Vinyals and Koray Kavukcuoglu and George van den Driessche and Edward Lockhart and Luis C. Cobo and Florian Stimberg and Norman Casagrande and Dominik Grewe and Seb Noury and Sander Dieleman and Erich Elsen and Nal Kalchbrenner and Heiga Zen and Alex Graves and Helen King and Tom Walters and Dan Belov and Demis Hassabis},
  journal= {arXiv preprint arXiv:1711.10433},
  year   = {2017}
}