s-Transformer:用于鲁棒神经语音合成的片段级 Transformer
音频与语音处理
2020-11-18 v1 声音
摘要
采用循环模型(如 Tacotron)或注意力模型(如 Transformer)来刻画语音语句的神经端到端文本转语音(TTS)在语音合成方面取得了显著改进。然而,处理不同句子长度仍极具挑战性,尤其是对于序列模型有效上下文长度受限的长句子。我们提出了一种新颖的片段级 Transformer(s-Transformer),其在片段级别对语音建模,并通过缓存记忆在编码器和解码器中复用循环机制。扩展记忆可捕获长距离上下文,同时片段上的编码器-解码器注意力更易于处理。此外,我们采用改进的相对位置自注意力,以使序列长度能泛化到训练数据中可能未出现的周期之外。将所提 s-Transformer 与标准 Transformer 比较:在短句上,两者均达到 4.29 的 MOS 分数,非常接近录音的 4.32;长句上分数相近(4.22 对 4.2);在超长句上显著更优,MOS 提升 0.2。由于缓存记忆随时间更新,s-Transformer 能在较长时间内生成相当自然且连贯的语音。
引用
@article{arxiv.2011.08480,
title = {s-Transformer: Segment-Transformer for Robust Neural Speech Synthesis},
author = {Xi Wang and Huaiping Ming and Lei He and Frank K. Soong},
journal= {arXiv preprint arXiv:2011.08480},
year = {2020}
}
备注
5 pages, 5 figures