中文

VARA-TTS:基于带残差注意力的极深 VAE 的非自回归语音合成

声音 2021-02-15 v1 计算与语言 音频与语音处理

摘要

本文提出 VARA-TTS,一种使用带残差注意力机制的极深变分自编码器(VDVAE)的非自回归(non-AR)语音合成(TTS)模型,该机制以逐层方式细化文本到声学的对齐。来自 VDVAE 的具有不同时间分辨率的分层潜变量被用作残差注意力模块的查询。通过利用前一层注意力得到的粗略全局对齐作为额外输入,后续注意力层可生成精细化的对齐版本。这将文本到声学对齐的学习负担分摊到多个注意力层中,并在鲁棒性上优于仅使用单一注意力层。一个话语级语速因子由联合训练的语速预测器计算,该预测器以最粗层的均值池化潜变量作为输入,以在推理时确定声学帧数。实验结果表明,VARA-TTS 的语音质量略逊于自回归对手 Tacotron 2,但推理速度提升一个数量级;并且在语音质量上优于类似的非自回归模型 BVAE-TTS。

关键词

引用

@article{arxiv.2102.06431,
  title  = {VARA-TTS: Non-Autoregressive Text-to-Speech Synthesis based on Very Deep VAE with Residual Attention},
  author = {Peng Liu and Yuewen Cao and Songxiang Liu and Na Hu and Guangzhi Li and Chao Weng and Dan Su},
  journal= {arXiv preprint arXiv:2102.06431},
  year   = {2021}
}