EE-TTS:融合语言信息的强调型表现力语音合成
声音
2025-05-27 v2 计算与语言
音频与语音处理
摘要
尽管当前的 TTS 系统在高保真语音合成方面表现良好,但生成高表现力语音仍具挑战。强调作为决定语音表现力的关键因素,近年来受到更多关注。以往工作通常通过添加中间特征来增强强调,但无法保证语音的整体表现力。为解决此问题,我们提出强调型表现力语音合成(EE-TTS),其利用来自句法与语义的多层级语言信息。EE-TTS 包含一个可从文本中识别恰当强调位置的强调预测器,以及一个以强调和语言信息为条件合成表现力语音的声学模型。实验结果表明,EE-TTS 在表现力与自然度上的 MOS 分别较基线提升 0.49 和 0.67。AB 测试结果还显示 EE-TTS 在不同数据集间具有强泛化能力。
引用
@article{arxiv.2305.12107,
title = {EE-TTS: Emphatic Expressive TTS with Linguistic Information},
author = {Yi Zhong and Chen Zhang and Xule Liu and Chenxi Sun and Weishan Deng and Haifeng Hu and Zhongqian Sun},
journal= {arXiv preprint arXiv:2305.12107},
year = {2025}
}
备注
Accepted by Interspeech 2023, fix some typos