中文

EE-TTS:融合语言信息的强调型表现力语音合成

声音 2025-05-27 v2 计算与语言 音频与语音处理

摘要

尽管当前的 TTS 系统在高保真语音合成方面表现良好,但生成高表现力语音仍具挑战。强调作为决定语音表现力的关键因素,近年来受到更多关注。以往工作通常通过添加中间特征来增强强调,但无法保证语音的整体表现力。为解决此问题,我们提出强调型表现力语音合成(EE-TTS),其利用来自句法与语义的多层级语言信息。EE-TTS 包含一个可从文本中识别恰当强调位置的强调预测器,以及一个以强调和语言信息为条件合成表现力语音的声学模型。实验结果表明,EE-TTS 在表现力与自然度上的 MOS 分别较基线提升 0.49 和 0.67。AB 测试结果还显示 EE-TTS 在不同数据集间具有强泛化能力。

关键词

引用

@article{arxiv.2305.12107,
  title  = {EE-TTS: Emphatic Expressive TTS with Linguistic Information},
  author = {Yi Zhong and Chen Zhang and Xule Liu and Chenxi Sun and Weishan Deng and Haifeng Hu and Zhongqian Sun},
  journal= {arXiv preprint arXiv:2305.12107},
  year   = {2025}
}

备注

Accepted by Interspeech 2023, fix some typos