中文

VisRes 基准:评估视觉语言模型中视觉推理能力

计算机视觉与模式识别 2025-12-25 v1

摘要

视觉语言模型(VLMs)在视觉问答和图像描述等任务上取得了显著进展。然而,这些模型是否表现出视觉推理能力,抑或仅依赖语言先验仍不明确。为此,我们提出VisRes 基准,旨在无需上下文语言监督的情况下研究视觉推理。分析不同复杂度水平下的模型行为,我们发现感知和关系视觉推理能力存在明显局限。VisRes 在各水平上隔离了不同的推理能力。第1层探测在模糊、纹理变化、遮挡和旋转等扰动下的感知完成和全局图像匹配;第2层测试针对单个属性(如颜色、计数、方向)的规则推理;第3层针对需要整合多个视觉属性的组合推理。我们在超过19,000个受控任务图像上发现,最先进的VLMs在细微的感知扰动下表现接近随机,这揭示了其在模式识别之外的抽象能力有限。我们指出VisRes为多模态研究中抽象视觉推理提供了统一框架。

关键词

引用

@article{arxiv.2512.21194,
  title  = {VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs},
  author = {Brigitta Malagurski Törtei and Yasser Dahou and Ngoc Dung Huynh and Wamiq Reyaz Para and Phúc H. Lê Khac and Ankit Singh and Sofian Chaybouti and Sanath Narayan},
  journal= {arXiv preprint arXiv:2512.21194},
  year   = {2025}
}