中文

AgentGrounder:基于多模态语言模型的零样本三维视觉点云定位

计算机视觉与模式识别 2026-05-26 v1 机器人学

摘要

三维视觉定位(3DVG)是具身智能的一项核心能力,要求智能体根据自然语言描述在三维场景中定位物体。最近的零样本方法利用了二维视觉语言模型(LVLM)。然而,这些方法通常依赖于现成的多视角图像集,并且难以处理标准三维分割工具所提供的有限语义和空间细节。我们提出了AgentGrounder\textbf{AgentGrounder},这是一个零样本的三维视觉定位框架,它直接对彩色点云进行操作,无需针对特定任务的三维训练。我们的方法采用两阶段设计:(1)一个离线阶段,应用三维模型构建一个包含实例ID、语义标签和三维边界框的对象查找表(OLT);(2)一个在线工具驱动智能体,该智能体分解每个查询,仅从OLT中检索相关候选对象,执行几何评分,并在需要额外视觉证据(例如颜色、材质或视角敏感线索)时按需触发图像渲染。与固定的锚点-目标匹配流程相比,这种设计减少了级联匹配错误,并通过避免用无关对象过载提示来提高上下文窗口效率。我们在零样本设置下对ScanRefer和Nr3D进行了评估,观察到在我们的设置中,与SeeGround相比有持续改进,包括在ScanRefer上[email protected]提高了+2.5%,在Nr3D上提高了+6.3%,在Nr3D视角无关查询上显著提高了+6.3%。这些结果表明,结合选择性检索、几何推理和自适应视觉检查,为开放词汇的三维定位提供了一个实用且稳健的基础。我们的代码可在https://github.com/be2rlab/AgentGrounder获取。

关键词

引用

@article{arxiv.2605.25901,
  title  = {AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models},
  author = {Cuong Huynh and Maxim Popov and Denis Gridusov and Sergey Kolyubin},
  journal= {arXiv preprint arXiv:2605.25901},
  year   = {2026}
}

备注

Code: https://github.com/be2rlab/AgentGrounder