DurIAN-E:用于表现力语音合成的音长感知注意力网络
音频与语音处理
2023-09-25 v1 声音
摘要
本文介绍了一种改进的音长感知注意力神经网络(DurIAN-E),用于表现力强且高保真的文本到语音(TTS)合成。该模型继承自原始 DurIAN 模型,采用了一种自回归模型结构,其中输入语言信息与输出声学特征之间的对齐由音长模型推断得出。同时,所提出的 DurIAN-E 利用多个堆叠的基于 SwishRNN 的 Transformer 模块作为语言编码器。风格自适应实例归一化(SAIN)层被引入帧级编码器中,以提升表现力的建模能力。构建了一个结合用于梅尔频谱图的去噪扩散概率模型(DDPM)与 SAIN 模块的去噪器,以进一步提升合成语音的质量与表现力。实验结果证明,本文提出的表现力 TTS 模型在主观平均意见分(MOS)和偏好测试中均优于当前最先进的方法。
引用
@article{arxiv.2309.12792,
title = {DurIAN-E: Duration Informed Attention Network For Expressive Text-to-Speech Synthesis},
author = {Yu Gu and Yianrao Bian and Guangzhi Lei and Chao Weng and Dan Su},
journal= {arXiv preprint arXiv:2309.12792},
year = {2023}
}