神经 TTS 中利用词嵌入与句法分析信息强化特征的方法
声音
2019-03-07 v2 计算与语言
音频与语音处理
摘要
本文在序列到序列神经文本到语音 (TTS) 合成框架下提出一种特征强化方法。该方法利用多输入编码器,将音素序列、预训练词嵌入以及来自句法分析器的句子语法结构这三个层次的文本信息作为神经 TTS 系统的输入特征。所增加的词级与句子级信息可视为基于特征的预训练策略,明显增强了模型的泛化能力。实验表明,该方法不仅显著提升了系统鲁棒性,还使合成语音对于域外文本达到接近录音的质量。
引用
@article{arxiv.1901.00707,
title = {Feature reinforcement with word embedding and parsing information in neural TTS},
author = {Huaiping Ming and Lei He and Haohan Guo and Frank K. Soong},
journal= {arXiv preprint arXiv:1901.00707},
year = {2019}
}