中文

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

计算机视觉与模式识别 2026-01-21 v1 机器学习

摘要

视觉基础模型(VFMs),如DINO和CLIP,在图像的语义理解方面表现出色,但空间推理能力有限,这限制了它们在具身系统中的应用。因此,近期工作将一些3D任务(如深度估计)纳入VFM训练。然而,VFM在其他空间任务上的表现仍不一致,这引发了这些模型是否真正具有空间感知能力,还是仅仅过拟合于特定3D目标的问题。为解决这一问题,我们引入了空间关系识别任务(SpaRRTa)基准,用于评估VFM识别图像中物体相对位置的能力。与专注于精确度量预测(例如表面法线估计)的传统3D目标不同,SpaRRTa探究的是支撑更高级类人空间理解形式的基础能力。SpaRRTa可生成任意数量的、具有多样化场景和完全可控物体布局的照片级真实感图像,并提供可自由获取的空间标注。通过评估一系列最先进的VFM,我们揭示了它们空间推理能力之间的显著差异。通过分析,我们为现代VFM中支持或阻碍空间感知的机制提供了见解。我们希望SpaRRTa能成为指导未来空间感知视觉模型发展的有用工具。

关键词

引用

@article{arxiv.2601.11729,
  title  = {SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models},
  author = {Turhan Can Kargin and Wojciech Jasiński and Adam Pardyl and Bartosz Zieliński and Marcin Przewięźlikowski},
  journal= {arXiv preprint arXiv:2601.11729},
  year   = {2026}
}

备注

Project page is available at https://sparrta.gmum.net/