中文

OpenGround:基于主动认知推理的开放世界 3D 视觉定位

计算机视觉与模式识别 2026-01-01 v2 人工智能

摘要

3D 视觉定位旨在根据自然语言描述在 3D 场景中定位物体。现有方法依赖预定义的对象查找表(OLT)来查询视觉语言模型(VLM)以推理物体位置,这限制了其在目标未定义或不可预见场景中的应用。为解决此问题,我们提出了 OpenGround,一种用于开放世界 3D 视觉定位的新型零样本框架。OpenGround 的核心是主动认知推理(ACR)模块,该模块旨在通过逐步扩展 VLM 的认知范围来克服预定义 OLT 的根本限制。ACR 模块通过认知任务链对目标进行类人感知,并主动推理上下文相关物体,从而通过动态更新的 OLT 扩展 VLM 的认知。这使得 OpenGround 能够同时处理预定义类别和开放世界类别。我们还提出了一个名为 OpenTarget 的新数据集,其中包含超过 7000 个物体-描述对,用于在开放世界场景中评估我们的方法。大量实验表明,OpenGround 在 Nr3D 上取得了有竞争力的性能,在 ScanRefer 上达到了 SOTA,并在 OpenTarget 上实现了 17.6% 的大幅提升。项目页面位于 https://why-102.github.io/openground.io/。

关键词

引用

@article{arxiv.2512.23020,
  title  = {OpenGround: Active Cognition-based Reasoning for Open-World 3D Visual Grounding},
  author = {Wenyuan Huang and Zhao Wang and Zhou Wei and Ting Huang and Fang Zhao and Jian Yang and Zhenyu Zhang},
  journal= {arXiv preprint arXiv:2512.23020},
  year   = {2026}
}

备注

27 pages, 15 figures, 14 tables, Project Page at https://why-102.github.io/openground.io/