EME-TTS:解锁语音合成中的强调与情感联系
声音
2025-07-17 v1 音频与语音处理
摘要
近年来,情感文本转语音(TTS)合成和可控语音强化合成取得了显著进展。然而,它们之间的交互作用仍未得到充分探讨。我们提出一种强调情感文本转语音框架(EME-TTS),旨在回答两个关键问题:(1)如何有效利用强化来增强情感语音的表达性,(2)如何在不同情感下保持目标强化的感知清晰度和稳定性。EME-TTS采用弱监督学习,结合强化伪标签和基于方差的强化特征。此外,提出的强化感知增强(EPE)模块增强了情感信号与强化位置之间的交互作用。实验结果表明,EME-TTS结合大型语言模型进行强化位置预测,能够在保持稳定且可区分的目标强化的同时,实现更自然的情感语音合成。合成样本已在线发布。
引用
@article{arxiv.2507.12015,
title = {EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis},
author = {Haoxun Li and Leyuan Qu and Jiaxi Hu and Taihao Li},
journal= {arXiv preprint arXiv:2507.12015},
year = {2025}
}
备注
Accepted by INTERSPEECH 2025