中文

面向物理知识驱动的空间智能:基于人类先验的自动驾驶试点研究

计算机视觉与模式识别 2025-10-27 v1

摘要

如何集成和验证基础模型中的空间智能仍是开放挑战。当前实践常以纯文本提示和VQA风格评分来近似表示视觉-空间智能(VSI),这掩盖了几何信息,诱导语言捷径,削弱了对真正空间技能的归因。我们引入空间智能网格(SIG):一种结构化、基于网格的模式,显式编码物体布局、物体间关系以及物理先验。作为文本的补充通道,SIG为基础模型推理提供了可靠、可组合的场景结构表征。基于SIG,我们推导出SIG信息化的评估指标,用于量化模型的内在VSI,将其与语言先验分离。在基于最新多模态LLM(如GPT和Gemini系列模型)的少样本情境学习中,SIG consistently 获得更大、更稳定且更全面的VSI指标提升,表明其作为学习VSI的数据标注和训练模式具有潜力。我们还发布了SIGBench:一个包含1.4K帧驾驶场景的基准,标注了真实的SIG标签和人类凝视轨迹,支持基于网格的机器VSI任务以及面向自动驾驶场景的注意力驱动式、类人VSI任务。

关键词

引用

@article{arxiv.2510.21160,
  title  = {Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study},
  author = {Guanlin Wu and Boyan Su and Yang Zhao and Pu Wang and Yichen Lin and Hao Frank Yang},
  journal= {arXiv preprint arXiv:2510.21160},
  year   = {2025}
}

备注

NeurIPS 2025 (Spotlight)