中文

看不见却懂了:大语言模型感知-认知差异基准测试

计算与语言 2025-09-24 v3

摘要

随着多模态大语言模型(MLLM)的快速发展,它们在各种视觉语言任务中展现出卓越的能力。然而,当前的评估基准主要关注客观的视觉问答或描述,未能充分评估模型理解复杂和主观人类情感的能力。为填补这一差距,我们提出了 EmoBench-Reddit,这是一个用于多模态情感理解的新型分层基准。该数据集包含来自社交媒体平台 Reddit 的 350 个精心挑选的样本,每个样本包含一张图片、关联的用户提供文本以及经用户 flair 确认的情感类别(悲伤、幽默、讽刺、快乐)。我们设计了分层任务框架,从基础感知到高级认知逐步推进,每个数据点包含六个多选问题和一个开放式问题,难度递增。感知任务评估模型识别基础视觉元素(如颜色、物体)的能力,而认知任务要求进行场景推理、意图理解和整合文本上下文进行深层共情。我们通过结合 AI辅助(Claude 4)和人工核查确保了标注质量。我们对九个领先的 MLLM(包括 GPT-5、Gemini-2.5-pro 和 GPT-4o)在 EmoBench-Reddit 上的进行了全面评估。

关键词

引用

@article{arxiv.2509.11101,
  title  = {Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models},
  author = {Haokun Li and Yazhou Zhang and Jizhi Ding and Qiuchi Li and Peng Zhang},
  journal= {arXiv preprint arXiv:2509.11101},
  year   = {2025}
}

备注

I need to modify the content of the article