中文

利用 SUS 约束 VAE 与文本编码器聚合改进情感语音合成

声音 2022-01-31 v2 音频与语音处理

摘要

从参考音频中学习情感嵌入是编码器-解码器系统中多情感语音合成的一种直接方法。但如何获得更好的情感嵌入,以及如何将其更有效地注入 TTS 声学模型,仍在研究中。本文中,我们提出一种创新约束以帮助 VAE 提取具有更好簇内凝聚力的情感嵌入。此外,所获得的情感嵌入用作查询,通过注意力聚合所有编码器层的潜在表示。而且,来自编码器层自身的查询也有帮助。实验证明所提方法能增强对综合句法和语义信息的编码,并生成更具表现力的情感语音。

关键词

引用

@article{arxiv.2110.09780,
  title  = {Improving Emotional Speech Synthesis by Using SUS-Constrained VAE and Text Encoder Aggregation},
  author = {Fengyu Yang and Jian Luan and Yujun Wang},
  journal= {arXiv preprint arXiv:2110.09780},
  year   = {2022}
}

备注

accepted by ICASSP2022