SpaceMind:面向空间推理的基于摄像机引导的模态融合方法
计算机视觉与模式识别
2025-12-05 v2 人工智能
摘要
大型视觉语言模型(VLM)在多模态理解方面表现出强大的能力,但在3D空间推理(如距离估计、尺寸比较和跨视图一致性)方面仍存在挑战。现有的3D感知方法要么依赖辅助3D信息,要么通过浅层特征融合将RGB-only VLM与几何编码器集成。我们提出SpaceMind,一个专为仅从RGB输入进行空间推理而设计的多模态大语言模型。该模型采用双编码器架构,集成VGGT作为空间理解编码器,InternViT作为2D视觉编码器。关键思想是将相机表示视为主动的引导模态而非被动的元数据。具体而言,SpaceMind在语言模型之前引入轻量级的相机引导模态融合模块,以取代浅层融合。它应用相机条件化的空间标记偏置,分配反映其几何重要性的查询无关权重,并利用相机嵌入对融合表示进行门控。经验上,SpaceMind在VSI-Bench、SQA3D和SPBench上建立了新的最高成绩,凭借在VSI-Bench和SPBench上的显著优势超过了开源和专有系统,在SQA3D上实现了最佳性能。这些结果表明,相机引导的模态融合是为VLMs赋予真正空间感知智能的有效且实用的归纳偏置。我们将发布代码和模型检查点以支持未来研究。
引用
@article{arxiv.2511.23075,
title = {SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models},
author = {Ruosen Zhao and Zhikang Zhang and Jialei Xu and Jiahao Chang and Dong Chen and Lingyun Li and Weijian Sun and Zizhuang Wei},
journal= {arXiv preprint arXiv:2511.23075},
year = {2025}
}