具备三种 grounding 能力的 3D 注意型空间视觉语言模型
计算机视觉与模式识别
2026-05-29 v1
摘要
我们提出 GR3D,一种具备三种互补 grounding 能力的空间视觉语言模型:显式 2D grounding、隐式 2D grounding 以及单目 3D grounding。GR3D 引入一种隐式 grounding 机制,在生成过程中识别实体指称并将相应区域 token 插入文本流,从而在生成空间链条式响应时随时引用视觉证据。同时,采用区域触发的单目 3D grounding 设计,从 grounded region 查询预测相机视图中的 3D 框架框,采用内在感知归一化和稠密几何监督。这些 grounding 能力使得 GR3D 能够将复杂的空间理解问题分解为基于 grounding 的 2D 感知 followed by 3D 推理。GR3D 在具备 grounding 和不具备 grounding 的空间基准测试中均实现了一致的提升,表明 grounding 作为增强 VLMs 中空间理解的有效归纳偏置。
引用
@article{arxiv.2605.30307,
title = {Grounded 3D-Aware Spatial Vision-Language Modeling},
author = {An-Chieh Cheng and Yang Fu and Yatai Ji and Ligeng Zhu and Guanqi Zhan and Zhuoyang Zhang and Zhaojing Yang and Song Han and Yao Lu and Pavlo Molchanov and Vidya Nariyambut Murali and Jan Kautz and Xiaolong Wang and Hongxu Yin and Sifei Liu},
journal= {arXiv preprint arXiv:2605.30307},
year = {2026}
}
备注
CVPR 2026 https://www.anjiecheng.me/gr3d