中文

SPHERE:通过分层评估揭示视觉语言模型中的空间盲点

计算机视觉与模式识别 2025-06-10 v4 人工智能

摘要

当前的视觉语言模型能够掌握基本的空间线索和简单的方向(例如左、右、前、后),但在实现类人理解与现实世界应用所需的多维空间推理方面仍存在困难。为弥补这一差距,我们开发了 SPHERE(空间感知与推理分层评估),这是一个由新的人工标注数据集支持的分层评估框架。SPHERE 系统地在不断增加的复杂度层级上探测模型,从基本技能到多技能整合,再到结合空间、视觉与逻辑理解的高级推理。对最先进模型的基准评估揭示了显著的缺陷,特别是在距离与邻近性推理、理解自我中心与他者中心视角,以及在物理情境中应用空间逻辑方面。这些发现暴露了现有模型中的关键盲点,并强调了对更先进空间推理技术的需求,推动视觉语言模型的发展更紧密地契合人类空间认知。SPHERE 基准可从 https://github.com/zwenyu/SPHERE-VLM 获取。

关键词

引用

@article{arxiv.2412.12693,
  title  = {SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation},
  author = {Wenyu Zhang and Wei En Ng and Lixin Ma and Yuwen Wang and Junqi Zhao and Allison Koenecke and Boyang Li and Lu Wang},
  journal= {arXiv preprint arXiv:2412.12693},
  year   = {2025}
}

备注

Accepted to ACL 2025