Tri-Bench:在相机倾斜与物体干扰下压力测试视觉语言模型空间推理可靠性
计算机视觉与模式识别
2025-12-10 v1
摘要
可验证的几何推理是构建可信且可控的智能体 AI 的关键组成部分。尽管视觉语言模型(VLM)展现出令人印象深刻的能力,但在真实场景变化下常常失效。我们提出了 Tri-Bench,一个紧凑的基准测试集,包含平面三角形问题,在隔离相对几何推理的同时,对两个部署关键因素施加压力:相机姿态(平面 vs. 倾斜)和场景上下文(通过 10 种日常物体产生的干扰)。为测试可验证性与可控性,我们使用四个近期 VLM 进行评估,采用单一固定提示,其护栏明确描述了周围的方形边框,从而通过单应性变换获得正确答案。我们在二元与连续目标上评估六种简单任务,观察到相对于三维真值的整体准确率较为温和,平均约 69%(最佳约 75%,最差约 64%)。相同响应在图像平面中的二维投影上吻合度更高,平均准确率为约 72%。四个 VLM 在识别少数形状类别(等边、等腰、直角三角形)时始终失败,准确率降至约 0%。此外,整体 VLM 准确率在相机倾斜下下降约 4.1%。这表明模型未能正确利用提示中提供的显式参考框架提示,而默认依赖二维图像平面线索。最后,我们发现物体干扰对 VLM 准确率没有显著影响。
引用
@article{arxiv.2512.08860,
title = {Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference},
author = {Amit Bendkhale},
journal= {arXiv preprint arXiv:2512.08860},
year = {2025}
}
备注
6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)