BareBones:视觉语言模型中零样几何理解的基准测试
计算机视觉与模式识别
2026-05-05 v3
摘要
虽然视觉语言模型(VLMs)在多模态任务中展示出惊人的零样识别能力,但这些架构是否真正理解几何结构或仅依赖 RGB 纹理和上下文先验作为统计捷径仍是未知的。现有评估未能隔离此机制,将语义推理与纹理映射混合,并依赖不精确的注释不慎泄露环境线索。为解决这一问题,我们引入 ,一个设计用于检验纯几何形状理解的零样本基准测试。我们收集了来自六个数据集的像素级轮廓:五个已建立的分割来源(ImageNet-S、DIS5K、ThinObject5K、PASCAL VOC、CUB-200)和我们新颖的旗舰集合 WTP-Bench,建立了无噪声的几何分类学。WTP-Bench 是一种极端的细粒度视觉谜题,迫使模型仅从边界轮廓中识别跨类的几何概念。我们对 26 个最先进的专有和开源 VLMs(例如 GPT-4.1、Gemini、Claude Sonnet 4.5、LLaVA)进行评估,发现在 RGB 剥离下表现严重崩溃,这一现象我们称为 。通过记录普遍的结构盲区,BareBones 为真正的几何 grounding 建立了严格的尺度。项目页面:https://eternal-f1ame.github.io/WTP-Bench/
引用
@article{arxiv.2604.10528,
title = {BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs},
author = {Aaditya Baranwal and Vishal Yadav and Abhishek Rajora},
journal= {arXiv preprint arXiv:2604.10528},
year = {2026}
}
备注
Accepted at CVPR (13th FGVC Workshop) 2026