中文

用于神经 TTS 的具有逐步单调注意力的鲁棒序列到序列声学建模

计算与语言 2019-08-07 v3 机器学习 声音 音频与语音处理

摘要

神经 TTS 已展现出以高质量和自然度生成类人语音的强大能力,而就其基于注意力的序列到序列声学建模设计而言,其对域外文本的泛化仍是一项具有挑战性的任务。那些具有未见上下文的输入中会出现各种错误,包括注意力崩溃、跳过、重复等,这限制了更广泛的应用。在本文中,我们提出一种序列到序列声学建模中的新颖逐步单调注意力方法,以提升在域外输入上的鲁棒性。该方法利用 TTS 中严格的单调性质,对单调硬注意力施加约束:输入与输出序列间的对齐不仅必须是单调的,且不允许跳过输入。软注意力可用于规避训练与推理间的不匹配。实验结果表明,所提方法能在基于音素的模型上于域外场景取得鲁棒性的显著提升,且在域内自然度测试上无任何回退。

关键词

引用

@article{arxiv.1906.00672,
  title  = {Robust Sequence-to-Sequence Acoustic Modeling with Stepwise Monotonic Attention for Neural TTS},
  author = {Mutian He and Yan Deng and Lei He},
  journal= {arXiv preprint arXiv:1906.00672},
  year   = {2019}
}

备注

Accepted by Interspeech 2019, Graz, Austria; v3: typo fixed