通过以梅尔频谱预测为条件约束 WaveNet 的自然 TTS 合成
计算与语言
2018-02-19 v2
摘要
本文描述了 Tacotron 2,一种直接从文本进行语音合成的神经网络架构。该系统由一个循环序列到序列的特征预测网络组成,该网络将字符嵌入映射到梅尔尺度频谱图,随后由一个改进的 WaveNet 模型作为声码器,从这些频谱图合成时域波形。我们的模型取得了 的平均意见得分(MOS),与专业录制语音的 MOS 相当。为验证我们的设计选择,我们给出了系统中关键组件的消融研究,并评估了使用梅尔频谱图作为 WaveNet 输入(而非语言、时长和 特征)的影响。我们进一步证明,使用紧凑的声学中间表示能够显著简化 WaveNet 架构。
引用
@article{arxiv.1712.05884,
title = {Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions},
author = {Jonathan Shen and Ruoming Pang and Ron J. Weiss and Mike Schuster and Navdeep Jaitly and Zongheng Yang and Zhifeng Chen and Yu Zhang and Yuxuan Wang and RJ Skerry-Ryan and Rif A. Saurous and Yannis Agiomyrgiannakis and Yonghui Wu},
journal= {arXiv preprint arXiv:1712.05884},
year = {2018}
}
备注
Accepted to ICASSP 2018