中文

GraphTTS:神经文本转语音中的图到序列建模

音频与语音处理 2020-03-05 v1 计算与语言 声音

摘要

本文在神经文本转语音中利用了图到序列方法(GraphTTS),其将输入序列的图嵌入映射至频谱图。图输入由从输入文本构建的节点与边表示组成。这些图输入的编码通过GNN编码器模块融入句法信息。此外,将GraphTTS的编码器作为图辅助编码器(GAE)应用,可从文本的语义结构中分析韵律信息。这可去除参考音频的手动选择过程,并使韵律建模成为端到端流程。实验分析显示GraphTTS在平均意见得分(MOS)上以0.24优于最先进的序列到序列模型。GAE可自动调节合成音频的停顿、换气与音调。该实验结论或可为致力于改善语音合成韵律的研究者提供一些启发。

关键词

引用

@article{arxiv.2003.01924,
  title  = {GraphTTS: graph-to-sequence modelling in neural text-to-speech},
  author = {Aolan Sun and Jianzong Wang and Ning Cheng and Huayi Peng and Zhen Zeng and Jing Xiao},
  journal= {arXiv preprint arXiv:2003.01924},
  year   = {2020}
}

备注

Accepted to ICASSP 2020