中文

HiGNN-TTS:基于图神经网络的分层韵律建模用于表现力长文本语音合成

声音 2023-10-10 v2 音频与语音处理

摘要

文本到语音的最新进展,尤其是那些基于图神经网络(GNN)的方法,已显著提升了短文本合成语音的表现力。然而,生成具有高度动态韵律变化、达到人类水平的长文本语音仍具挑战。为解决此问题,我们以一种名为 HiGNN-TTS 的分层韵律建模方法扩展了 GNN 的能力。具体而言,我们在图中加入一个虚拟全局节点以加强词节点间的互联,并引入上下文注意力机制,将 GNN 的韵律建模范围从句内拓宽至句间。此外,我们在图的各节点上施加来自声学韵律的分层监督,以捕获高动态范围的韵律变化。消融实验显示了 HiGNN-TTS 在学习分层韵律上的有效性。客观与主观评测均表明,HiGNN-TTS 显著提升了长文本合成语音的自然度与表现力。

关键词

引用

@article{arxiv.2309.13907,
  title  = {HiGNN-TTS: Hierarchical Prosody Modeling with Graph Neural Networks for Expressive Long-form TTS},
  author = {Dake Guo and Xinfa Zhu and Liumeng Xue and Tao Li and Yuanjun Lv and Yuepeng Jiang and Lei Xie},
  journal= {arXiv preprint arXiv:2309.13907},
  year   = {2023}
}

备注

Accepted by ASRU2023