VGRP-Bench:面向大型视觉语言模型的视觉网格推理谜题基准
计算机视觉与模式识别
2025-04-03 v2
摘要
大型视觉语言模型(LVLMs)在处理需要精确感知、规则理解和逻辑推理的谜题时面临困难。评估并提升其在该领域的能力至关重要,因为这反映了其进行结构化推理的能力——这是解决实际问题的一项必备技能。然而,现有的基准主要评估预训练模型而未进行额外训练或微调,通常缺乏对推理的专门关注,且未能建立系统的评估框架。为了解决这些局限性,我们引入了 VGRP-Bench,一个包含 20 种不同谜题的视觉网格推理谜题基准。VGRP-Bench 涵盖多个难度级别,并不仅在现有的对话型 LVLMs(如 GPT-4o)上进行了广泛实验,还在推理型 LVLMs(如 Gemini-Thinking)上进行了实验。我们的结果表明,即使是 SOTA 的 LVLMs 在处理这些谜题时也面临困难,凸显了其解题能力的根本局限性。最重要的是,通过系统实验,我们识别并分析了影响 LVLMs 谜题解题表现的关键因素,包括线索数量、网格大小和规则复杂度。此外,我们探讨了两种可用于后训练的监督微调(SFT)策略:基于解的 SFT(S-SFT)和基于合成推理过程的 SFT(R-SFT)。虽然这两种方法都显著提升了在已训练谜题上的表现,但它们对未见过的谜题泛化能力有限。我们将发布 VGRP-Bench,以促进关于 LVLMs 解决复杂现实问题的进一步研究。项目页面:https://yufan-ren.com/subpage/VGRP-Bench/。
引用
@article{arxiv.2503.23064,
title = {VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models},
author = {Yufan Ren and Konstantinos Tertikas and Shalini Maiti and Junlin Han and Tong Zhang and Sabine Süsstrunk and Filippos Kokkinos},
journal= {arXiv preprint arXiv:2503.23064},
year = {2025}
}
备注
8 pages; Project page: https://yufan-ren.com/subpage/VGRP-Bench/