CAPTURe:通过遮挡物计数评估视觉语言模型的空间推理能力
计算机视觉与模式识别
2025-08-15 v2 人工智能
计算与语言
摘要
识别和推理关于被遮挡(部分或完全隐藏)物体的情形,是理解视觉场景的关键,因为遮挡在真实环境中频繁发生,并成为空间理解的障碍。为测试模型推理多个遮挡物体的能力,我们引入了一种新任务,计数通过不可见区域模式(Counting Amodally for Patterns Through Unseen REgions, CAPTURe),该任务要求模型推断遮挡物(阻挡场景部分的物体)后,模式如何延续。CAPTURe要求模型识别视觉模式并进行推理,因而是评估视觉语言模型(VLM)是否理解遮挡模式并具备空间理解技能的有用基准。通过要求模型推理被遮挡的物体,CAPTURe还测试了VLM构建世界模型以填补缺失信息的能力。CAPTURe包含两个部分:(1) CAPTURe-real,包含经过筛选的真实物体图案图像;(2) CAPTURe-synthetic,为受控诊断性测试生成的图案化图像。我们对四个强大的VLM(GPT-4o、Intern-VL2、Molmo和Qwen2-VL)进行了CAPTURe评估,发现模型在遮挡和非遮挡图案上均难以计数。关键的是,我们发现遮挡情况下的模型表现更差,表明VLM在推断不可见的空间关系方面也存在不足:即便是最强的VLM如GPT-4o在遮挡情况下也无法准确计数。相比之下,我们发现人类在CAPTURe上几乎没有错误。我们还发现提供遮挡物体位置的辅助信息会提高性能,这表明模型错误来源于处理遮挡能力不足以及图像计数困难两方面。代码和数据:https://github.com/atinpothiraj/CAPTURe
引用
@article{arxiv.2504.15485,
title = {CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting},
author = {Atin Pothiraj and Elias Stengel-Eskin and Jaemin Cho and Mohit Bansal},
journal= {arXiv preprint arXiv:2504.15485},
year = {2025}
}
备注
ICCV 2025