中文

评估情感不一致语音模型的情感识别能力

计算与语言 2025-10-31 v2 音频与语音处理

摘要

语音处理领域的进步推动了spoken language models(SLMs)的发展,这类模型旨在通过联合学习文本与音频表征,实现通用的音频理解,适用于广泛的任务。尽管取得了令人鼓舞的成果,但关于这些模型泛化能力的讨论日益聚集,以及它们是否真正整合音频与文本模态于内部表征方面的疑问仍存在。本研究在情感不一致语音样本数据集上,对四类SLMs进行情感识别评估。该数据集包含情感不一致的语音样本——即说话语义传递的情感与语音表达的情感不匹配。我们的实验结果表明,SLMs在完成该任务时主要依赖文本语义而非语音情感,从而表明文本相关表征在语音表征中占据主导地位。我们将发布代码及情感不一致合成语音数据集(EMIS)供社区使用。

关键词

引用

@article{arxiv.2510.25054,
  title  = {Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech},
  author = {Pedro Corrêa and João Lima and Victor Moreno and Lucas Ueda and Paula Dornhofer Paro Costa},
  journal= {arXiv preprint arXiv:2510.25054},
  year   = {2025}
}

备注

Submitted to IEEE ICASSP 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses