Nana-HDR:一种用于TTS的非注意力非自回归混合模型
计算与语言
2021-09-29 v1 声音
音频与语音处理
摘要
本文提出Nana-HDR,一种用于TTS的具有基于Transformer的Dense-fuse编码器与基于RNN的解码器的新型非注意力非自回归模型。它主要由三部分组成:首先,一种在基础Transformer块间具有密集连接以进行粗特征融合、以及多层注意力层进行细特征融合的新型Dense-fuse编码器。其次,单层非自回归基于RNN的解码器。第三,连接上述混合编码器与解码器的时长预测器而非注意力模型。实验表明,Nana-HDR充分发挥了各组件优势,如基于Transformer的编码器的强文本编码能力、不受暴露偏差与局部信息偏好困扰的有状态解码,以及时长预测器提供的稳定对齐。得益于这些优势,Nana-HDR在两个普通话语料库上于自然度与鲁棒性方面取得具竞争力的性能。
引用
@article{arxiv.2109.13673,
title = {Nana-HDR: A Non-attentive Non-autoregressive Hybrid Model for TTS},
author = {Shilun Lin and Wenchao Su and Li Meng and Fenglong Xie and Xinhui Li and Li Lu},
journal= {arXiv preprint arXiv:2109.13673},
year = {2021}
}