中文

Argus 检查:多模态大语言模型是否具备全知之眼?

计算机视觉与模式识别 2025-08-13 v2 人工智能 计算与语言 机器学习 多媒体

摘要

随着多模态大语言模型(Multimodal Large Language Models, MLLMs)的不断演进,其认知与推理能力取得了显著进展。然而,在视觉细粒度感知和常识因果推断方面仍面临挑战。本文引入 Argus 检查(Argus Inspection),一个包含两层难度的多模态基准测试,强调详细的视觉识别,同时融入现实世界的常识理解,以评估因果推理能力。进一步地,我们提出了全知之眼(Eye of Panoptes)框架,通过引入二元参数 Sigmoid 度量与指示函数,实现对 MLLMs 在意见导向推理任务中响应的更全面评估。在 26 个主流 MLLMs 上的实验表明,视觉细粒度推理的最高性能仅达到 0.46,凸显了相当大的提升潜力。我们的研究为 MLLMs 的持续改进提供了宝贵的视角。

关键词

引用

@article{arxiv.2506.14805,
  title  = {Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?},
  author = {Yang Yao and Lingyu Li and Jiaxin Song and Chiyu Chen and Zhenqi He and Yixu Wang and Xin Wang and Tianle Gu and Jie Li and Yan Teng and Yingchun Wang},
  journal= {arXiv preprint arXiv:2506.14805},
  year   = {2025}
}