G$^2$VLM:基于统一3D重建与空间推理的几何 grounding 视觉语言模型
计算机视觉与模式识别
2025-12-01 v2 人工智能
计算与语言
摘要
视觉语言模型在空间智能方面仍显得不足,表现不佳,尤其是在空间理解和推理任务上。我们将这一差距归因于缺乏能够从2D图像重建3D空间的视觉几何学习过程。我们提出了 GVLM,一种几何 grounding 视觉语言模型,旨在桥接空间智能的两个基本方面:空间3D重建与空间理解。GVLM 原生利用学习到的3D视觉几何特征,直接预测3D属性,并通过上下文学习和交错推理来增强空间推理任务。我们的统一设计在空间理解方面具有高度可扩展性:它可以在丰富的多视角图像和视频数据上训练,同时利用通常仅从难以收集的注释中获得的3D视觉先验。实验结果表明,GVLM 在两项任务中都表现出色,能够实现与最先进的前馈3D重建模型相当的结果,在空间理解和推理任务中取得更好或相当的结果。通过将语义强大的 VLM 与低层3D视觉任务统一,我们希望 GVLM 能作为社区的强大基线,并解锁更多未来应用,例如3D场景编辑。
关键词
引用
@article{arxiv.2511.21688,
title = {G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning},
author = {Wenbo Hu and Jingli Lin and Yilin Long and Yunlong Ran and Lihan Jiang and Yifan Wang and Chenming Zhu and Runsen Xu and Tai Wang and Jiangmiao Pang},
journal= {arXiv preprint arXiv:2511.21688},
year = {2025}
}
备注
code are released at https://github.com/InternRobotics/G2VLM