中文

面向非自回归语音合成的分层上下文感知 Transformer

音频与语音处理 2021-06-30 v1

摘要

本文提出了改进基于 Transformer 的非自回归语音合成(TNA-TTS)模型建模性能的方法。尽管文本编码器和音频解码器处理不同类型和长度的数据(即文本和音频),但 TNA-TTS 模型在设计时并未考虑这些差异。因此,为提升 TNA-TTS 模型的建模性能,我们提出了一种基于分层 Transformer 结构的文本编码器和音频解码器,其设计分别适配各模块的特性。对于文本编码器,我们约束每个自注意力层,使编码器从局部到全局范围关注文本序列。相反,音频解码器将其自注意力层约束为以相反方向关注,即从全局到局部范围。此外,我们通过提供句子级和词级音高作为条件,进一步提升了音频解码器的音高建模精度。多种客观与主观评测验证了所提方法优于基线 TNA-TTS。

关键词

引用

@article{arxiv.2106.15144,
  title  = {Hierarchical Context-Aware Transformers for Non-Autoregressive Text to Speech},
  author = {Jae-Sung Bae and Tae-Jun Bak and Young-Sun Joo and Hoon-Young Cho},
  journal= {arXiv preprint arXiv:2106.15144},
  year   = {2021}
}

备注

Accepted to INTERSPEECH 2021