GraphTTS:神经文本转语音中的图到序列建模
音频与语音处理
2020-03-05 v1 计算与语言
声音
摘要
本文在神经文本转语音中利用了图到序列方法(GraphTTS),其将输入序列的图嵌入映射至频谱图。图输入由从输入文本构建的节点与边表示组成。这些图输入的编码通过GNN编码器模块融入句法信息。此外,将GraphTTS的编码器作为图辅助编码器(GAE)应用,可从文本的语义结构中分析韵律信息。这可去除参考音频的手动选择过程,并使韵律建模成为端到端流程。实验分析显示GraphTTS在平均意见得分(MOS)上以0.24优于最先进的序列到序列模型。GAE可自动调节合成音频的停顿、换气与音调。该实验结论或可为致力于改善语音合成韵律的研究者提供一些启发。
引用
@article{arxiv.2003.01924,
title = {GraphTTS: graph-to-sequence modelling in neural text-to-speech},
author = {Aolan Sun and Jianzong Wang and Ning Cheng and Huayi Peng and Zhen Zeng and Jing Xiao},
journal= {arXiv preprint arXiv:2003.01924},
year = {2020}
}
备注
Accepted to ICASSP 2020