中文

MME-CC:一个具有挑战性的多模态认知能力评估基准

计算与语言 2025-12-30 v2

摘要

随着推理模型的规模迅速扩大,多模态在人类认知中的关键作用日益凸显,推动了对探究以视觉为中心的认知行为的需求。然而,现有的多模态基准要么过度强调文本推理,要么未能系统性地捕捉以视觉为中心的认知行为,导致对多模态大语言模型(MLLM)认知能力的评估不足。为解决这一局限,我们引入了MME-CC(多模态认知能力评估基准),这是一个基于视觉的基准,它将11项代表性推理任务组织成视觉信息的三个基本类别:空间推理、几何推理和基于知识的推理,并提供了对这些维度上MLLM认知能力的细粒度分析。基于MME-CC,我们对16个具有代表性的MLLM进行了广泛实验。我们的研究揭示,闭源模型目前整体领先(例如,Gemini-2.5-Pro得分为42.66,而GLM-4.5V为30.45),而空间和几何推理能力普遍较弱(≤30%)。我们进一步识别了常见的错误模式,包括方向错误、脆弱的跨视角身份保持能力以及对反事实指令的遵从性差,并观察到思维链(Chain-of-Thought)通常遵循一个三阶段过程(提取 -> 推理 -> 验证),且高度依赖视觉提取。我们希望这项工作能推动将MLLM的认知能力视为评估和模型设计核心的转变。

关键词

引用

@article{arxiv.2511.03146,
  title  = {MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity},
  author = {Kaiyuan Zhang and Chenghao Yang and Zhoufutu Wen and Sihang Yuan and Qiuyue Wang and Chaoyi Huang and Guosheng Zhu and He Wang and Huawenyu Lu and Jianing Wen and Jianpeng Jiao and Lishu Luo and Longxiang Liu and Sijin Wu and Xiaolei Zhu and Xuanliang Zhang and Yu Liu and Ge Zhang and Yi Lin and Guang Shi and Chaoyou Fu and Wenhao Huang},
  journal= {arXiv preprint arXiv:2511.03146},
  year   = {2025}
}