MME-Emotion:多模态大语言模型情感智能的整体评估基准
计算机视觉与模式识别
2026-02-12 v2 人工智能
摘要
多模态大语言模型的最新进展催化了情感计算的变革性进展,使得模型能够展现出涌现的情感智能。尽管在方法论上取得了实质性进展,但当前的情感基准仍然有限,因为目前尚不清楚:MLLM在不同场景下的泛化能力,以及它们识别情感状态背后触发因素的推理能力。为了填补这些空白,我们提出了\textbf{MME-Emotion},一个系统性的基准,用于评估MLLM的情感理解和推理能力,具有\textit{可扩展容量}、\textit{多样化设置}和\textit{统一协议}。作为面向MLLM的最大情感智能基准,MME-Emotion包含超过6,000个精选视频片段及其特定任务的问答(QA)对,跨越广泛场景以构建八项情感任务。它进一步整合了一个整体评估套件,包含用于情感识别和推理的混合指标,并通过多智能体系统框架进行分析。通过对20个先进MLLM的严格评估,我们揭示了它们的优势和局限性,得出了几个关键见解:\ding{182} 当前MLLM表现出不令人满意的情感智能,表现最好的模型在我们的基准上仅实现了的识别分数和的思维链分数。\ding{183} 通用模型(\emph{例如},Gemini-2.5-Pro)从泛化的多模态理解能力中获取情感智能,而专用模型(\emph{例如},R1-Omni)可以通过特定领域的后训练适应实现相当的性能。通过引入MME-Emotion,我们希望它能成为未来推进MLLM情感智能的基础。
引用
@article{arxiv.2508.09210,
title = {MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models},
author = {Fan Zhang and Zebang Cheng and Chong Deng and Haoxuan Li and Zheng Lian and Qian Chen and Huadai Liu and Wen Wang and Yi-Fan Zhang and Renrui Zhang and Ziyu Guo and Zhihong Zhu and Hao Wu and Haixin Wang and Yefeng Zheng and Xiaojiang Peng and Xian Wu and Kun Wang and Xiangang Li and Jieping Ye and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2508.09210},
year = {2026}
}