中文

VRIQ:视觉推理智商基准化分析VLMs

计算机视觉与模式识别 2026-02-06 v1 机器学习

摘要

近期在视觉语言模型(VLM)方面的进展引发了这样的问题:它们能否可靠地执行非语言推理。为此,我们引入VRIQ(Visual Reasoning IQ),一个新型基准,旨在评估和分析VLMs的视觉推理能力。我们对模型进行两个任务集合的评估:抽象拼图式和自然图像推理任务。我们发现,在抽象拼图上,性能接近随机,平均准确率约为28%,而自然任务结果稍好但仍较弱,为45%。我们还发现,工具增强推理仅带来有限的改进。为揭示这种弱点的来源,我们引入诊断探针,针对感知和推理进行分析。我们的分析表明,约56%的失败源于感知因素,43%源于感知与推理的共同因素,仅有1%源于纯粹的推理因素。这促使我们设计针对特定感知类别(如形状、计数、位置、3D/深度)的细粒度诊断探针问题,揭示了某些类别导致更多失败。我们的基准和分析表明,当前VLMs,即使配备视觉推理工具,也仍是不可靠的抽象推理器,主要由于感知限制,为改进多模态系统的视觉推理提供了原则性依据。

关键词

引用

@article{arxiv.2602.05382,
  title  = {VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs},
  author = {Tina Khezresmaeilzadeh and Jike Zhong and Konstantinos Psounis},
  journal= {arXiv preprint arXiv:2602.05382},
  year   = {2026}
}