中文

VisOnlyQA:大型视觉语言模型在几何信息感知方面仍面临挑战

计算与语言 2025-07-15 v3 计算机视觉与模式识别

摘要

大型视觉语言模型(LVLMs)在各种视觉语言任务中取得了显著成绩。然而,LVLMs是否能够准确感知图像中的视觉信息仍不清楚。特别是,LVLMs感知几何信息(如形状、角度和大小)的能力尚未得到充分分析,尽管这种感知对于需要详细视觉理解的任务至关重要。本工作引入VisOnlyQA,用于评估LVLMs的几何感知能力,揭示LVLMs往往无法准确感知图像中的基本几何信息,而人类表现几乎完美。VisOnlyQA包含12项任务,直接询问几何形状、图表、化学结构和3D形状中的几何信息。我们的实验揭示了以下发现:(i)最先进的LVLMs在基本几何感知方面困难重重。我们评估的23个LVLMs,包括GPT-4o和Gemini 2.5 Pro,在VisOnlyQA上表现不佳。(ii)额外的训练数据无法解决此问题。即使在分布内任务上,对VisOnlyQA训练集进行微调也未必总是有效。(iii)LLM可能是瓶颈。使用更强LLM的LVLMs在VisOnlyQA上表现出更好的几何感知能力,而这不需要复杂的推理,表明LVLMs从视觉编码器处理信息的方式是瓶颈。提供了数据集、代码和模型响应,链接为https://github.com/psunlpgroup/VisOnlyQA。

关键词

引用

@article{arxiv.2412.00947,
  title  = {VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information},
  author = {Ryo Kamoi and Yusen Zhang and Sarkar Snigdha Sarathi Das and Ranran Haoran Zhang and Rui Zhang},
  journal= {arXiv preprint arXiv:2412.00947},
  year   = {2025}
}

备注

COLM 2025. VisOnlyQA dataset, code, and model responses are provided at https://github.com/psunlpgroup/VisOnlyQA. Please also refer to our project website at https://visonlyqa.github.io/