合成语音的情感理解
计算与语言
2026-03-18 v1
摘要
情感是语音交互中的核心语音特征。广泛认为,情感理解模型学习到的基本表征能够传递到合成语音上,使得情感理解结果成为评估情感表达合成语音的合理奖励或评估指标。在本工作中,我们通过在数据集、判别和生成式情感识别模型以及多样化合成模型上系统评估合成语音的情感识别(SER),来批判性地检验这一假设。我们发现当前的 SER 模型无法泛化到合成语音上,主要由于合成过程中的语音标记预测导致合成语音与人类语音之间的表征不匹配。此外,生成式语音语言模型(SLM)倾向于从文本语义推断情感,而忽略语音特征。总体而言,我们的发现表明,现有的 SER 模型常常利用非鲁棒的捷径,而非捕获基本特征,语音特征的理解在 SLM 中仍然具有挑战性。
引用
@article{arxiv.2603.16483,
title = {On the Emotion Understanding of Synthesized Speech},
author = {Yuan Ge and Haishu Zhao and Aokai Hao and Junxiang Zhang and Bei Li and Xiaoqian Liu and Chenglong Wang and Jianjin Wang and Bingsen Zhou and Bingyu Liu and Jingbo Zhu and Zhengtao Yu and Tong Xiao},
journal= {arXiv preprint arXiv:2603.16483},
year = {2026}
}