面向表达文本到语音合成的 DurIAN-E 2:基于自适应变分自编码器和对抗学习的持续感知注意网络
音频与语音处理
2024-10-18 v1 声音
摘要
本文提出了 DurIAN-E (DurIAN-E 2) 的改进版本,该模型也是一种面向表达和高保真度文本到语音 (TTS) 合成的持续感知注意网络。类似于 DurIAN-E 模型,本文利用多个堆叠的 SwishRNN-based Transformer 块作为语言编码器,并在帧级编码器中也利用 Style-Adaptive Instance Normalization (SAIN) 层,以提高所提出 DurIAN-E 2的表达建模能力。同时,受其他使用生成模型(如 VITS)的 TTS 模型的启发,DurIAN-E 2 利用增强于正规化流的变分自编码器 (VAE) 和带对抗训练策略的 BigVGAN 波形生成器,这进一步提高了合成语音的质量和表达性。客观测试和主观评估结果均证明,所提出的表达 TTS 模型 DurIAN-E 2 在多数 state-of-the-art 方法(包括 DurIAN-E)之外,性能更佳。
引用
@article{arxiv.2410.13288,
title = {DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis},
author = {Yu Gu and Qiushi Zhu and Guangzhi Lei and Chao Weng and Dan Su},
journal= {arXiv preprint arXiv:2410.13288},
year = {2024}
}
备注
Accepted by ICASSP2024