中文

WaveGrad 2:用于文本到语音合成的迭代细化

音频与语音处理 2021-06-22 v2 机器学习 声音

摘要

本文介绍 WaveGrad 2,一种用于文本到语音(text-to-speech)合成的非自回归生成模型。WaveGrad 2 被训练用于估计给定音素序列条件下波形对数条件密度的梯度。该模型接收输入音素序列,并通过迭代细化过程生成音频波形。这与原始 WaveGrad 声码器形成对比,后者以由独立模型生成的 mel-spectrogram 特征为条件。迭代细化过程从高斯噪声开始,并通过一系列细化步骤(例如 50 步)逐步恢复音频序列。WaveGrad 2 提供了一种通过调节细化步数在自然权衡推理速度与样本质量之间的方式。实验表明,该模型可生成高保真音频,逼近最先进神经 TTS 系统的性能。我们还报告了针对不同模型配置的多种消融研究。音频样本见 https://wavegrad.github.io/v2。

关键词

引用

@article{arxiv.2106.09660,
  title  = {WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis},
  author = {Nanxin Chen and Yu Zhang and Heiga Zen and Ron J. Weiss and Mohammad Norouzi and Najim Dehak and William Chan},
  journal= {arXiv preprint arXiv:2106.09660},
  year   = {2021}
}

备注

Proceedings of INTERSPEECH