中文

通过世界 grounding 实现空间推理

计算机视觉与模式识别 2025-10-17 v2

摘要

本文我们主张,3D 视觉 grounding 是空间推理的基石,引入 Grounded-Spatial Reasoner (GS-Reasoner) 以探索连接二者之间有效的空间表征。现有 3D 大语言模型因缺乏能够统一捕获语义与几何信息的 3D 表征而受限,这一缺陷表现为在 grounding 上的表现不佳,或过度依赖外部模块,从而阻碍了 grounding 与空间推理的无缝集成。为此,我们提出一种简洁而有效的双路径池化机制,紧密对齐几何特征与语义与位置线索,构建一种基于图像块的统一 3D 表征,无需增加输入 token 数量,即可包含所有必需信息。借助该整体表征,GS-Reasoner 是首个在没有外部模块的情况下实现自回归 grounding 的 3D 大语言模型,性能与 SOTA 模型相当,构建了 3D 空间推理的统一且自包含框架。为进一步桥接 grounding 与空间推理,我们引入 Grounded Chain-of-Thought (GCoT) 数据集。该数据集仔细筛选,包含对推理问题中被引用物体的 3D 边界框标注,以及将 grounding 作为问题解决过程核心组件的分步推理路径。大量实验表明,GS-Reasoner 在 3D 视觉 grounding 上取得卓越成绩,这进一步显著提升了其空间推理能力,实现了 SOTA 性能。

关键词

引用

@article{arxiv.2510.13800,
  title  = {Reasoning in Space via Grounding in the World},
  author = {Yiming Chen and Zekun Qi and Wenyao Zhang and Xin Jin and Li Zhang and Peidong Liu},
  journal= {arXiv preprint arXiv:2510.13800},
  year   = {2025}
}

备注

20 pages, 7 figures