中文

面向表达文本到语音合成的 DurIAN-E 2:基于自适应变分自编码器和对抗学习的持续感知注意网络

音频与语音处理 2024-10-18 v1 声音

摘要

本文提出了 DurIAN-E (DurIAN-E 2) 的改进版本,该模型也是一种面向表达和高保真度文本到语音 (TTS) 合成的持续感知注意网络。类似于 DurIAN-E 模型,本文利用多个堆叠的 SwishRNN-based Transformer 块作为语言编码器,并在帧级编码器中也利用 Style-Adaptive Instance Normalization (SAIN) 层,以提高所提出 DurIAN-E 2的表达建模能力。同时,受其他使用生成模型(如 VITS)的 TTS 模型的启发,DurIAN-E 2 利用增强于正规化流的变分自编码器 (VAE) 和带对抗训练策略的 BigVGAN 波形生成器,这进一步提高了合成语音的质量和表达性。客观测试和主观评估结果均证明,所提出的表达 TTS 模型 DurIAN-E 2 在多数 state-of-the-art 方法(包括 DurIAN-E)之外,性能更佳。

关键词

引用

@article{arxiv.2410.13288,
  title  = {DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis},
  author = {Yu Gu and Qiushi Zhu and Guangzhi Lei and Chao Weng and Dan Su},
  journal= {arXiv preprint arXiv:2410.13288},
  year   = {2024}
}

备注

Accepted by ICASSP2024