为多模态大语言模型定制视觉情感评估:开放词汇、多维且可扩展的方法
超导电性
2026-05-11 v2
摘要
近年来,多模态大语言模型(MLLM)在各种任务中取得了卓越表现,不断超越此前对其能力的预期。然而,它们从图像中感知情感的能力仍存在争议,零样本场景下的研究得出了相互矛盾的结果。我们认为,这种不一致性部分源于现有评估方法的限制,包括对合理响应的忽视、有限的情感分类体系、对语境因素的忽略以及劳动密集型的标注工作。为了促进针对 MLLM 的定制化视觉情感评估,我们提出了一种情感陈述判断任务来克服这些限制。作为补充,我们设计了一个自动化流水线,能够以最少的人工努力高效构建以情感为中心的陈述。通过系统地评估主流 MLLM,我们的研究展示了它们在情感解读和基于语境的情感判断方面的更强表现,同时揭示了其在理解感知主观性方面的相对局限。与人类相比,即使是最顶尖的 MLLM(如 GPT4o)也展现出显著的性能差距,凸显了未来改进的关键方向。通过开发基础评估框架并开展全面的 MLLM 评估,我们希望本工作有助于推进 MLLM 中的情感智能。项目页面:https://github.com/wdqqdw/MVEI。
引用
@article{arxiv.2509.21951,
title = {Extending the optical absorption in a lumped element meander structure to far-infrared wavelengths},
author = {Shekhar Chandra Pandey and Shilpam Sharma and Anudeep Singh and Utkarsh Pandey and S. S. Prabhu and Bhaskar Biswas and Sona Chandran and M. K. Chattopadhyay},
journal= {arXiv preprint arXiv:2509.21951},
year = {2026}
}