中文

通过以梅尔频谱预测为条件约束 WaveNet 的自然 TTS 合成

计算与语言 2018-02-19 v2

摘要

本文描述了 Tacotron 2,一种直接从文本进行语音合成的神经网络架构。该系统由一个循环序列到序列的特征预测网络组成,该网络将字符嵌入映射到梅尔尺度频谱图,随后由一个改进的 WaveNet 模型作为声码器,从这些频谱图合成时域波形。我们的模型取得了 4.534.53 的平均意见得分(MOS),与专业录制语音的 4.584.58 MOS 相当。为验证我们的设计选择,我们给出了系统中关键组件的消融研究,并评估了使用梅尔频谱图作为 WaveNet 输入(而非语言、时长和 F0F_0 特征)的影响。我们进一步证明,使用紧凑的声学中间表示能够显著简化 WaveNet 架构。

关键词

引用

@article{arxiv.1712.05884,
  title  = {Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions},
  author = {Jonathan Shen and Ruoming Pang and Ron J. Weiss and Mike Schuster and Navdeep Jaitly and Zongheng Yang and Zhifeng Chen and Yu Zhang and Yuxuan Wang and RJ Skerry-Ryan and Rif A. Saurous and Yannis Agiomyrgiannakis and Yonghui Wu},
  journal= {arXiv preprint arXiv:1712.05884},
  year   = {2018}
}

备注

Accepted to ICASSP 2018