中文

基于场景图的零射时3D视觉定位

计算机视觉与模式识别 2025-12-11 v1

摘要

3D视觉定位(3DVG)从语言描述中识别3D场景中的对象。现有的零射时方法利用2D视觉语言模型(VLM)通过将3D空间信息(SI)转换为VLM处理的形式(例如指定视图渲染或带有叠加对象标记的视频序列)来实现。然而,这种VLM + SI范式会导致视觉表征被纠缦,迫使VLM处理整个杂乱线索,难以有效利用空间语义关系。在本工作中,我们提出了新的VLM x SI范式,将3D SI外部化为一种形式,使VLM在推理时能够逐步检索所需内容。我们通过一种新颖的View-on-Graph(VoG)方法实现了该范式,将场景组织为多模态、多层次的场景图,使VLM能够作为一个主动代理,遍历场景时选择性地访问所需线索。该设计具有两个内在优势:(i) 通过将3D上下文结构化为具有空间和语义一致性的场景图,而不是将密集编织的视觉输入纠缦于VLM,从而降低了VLM的推理难度;(ii) 通过主动探索和遍历场景图,它自然产生用于可解释3DVG的透明、分步痕迹。广泛的实验表明,VoG在零射时性能方面实现了最先进的水平,确立了结构化场景探索作为推进零射时3DVG的有前景策略。

关键词

引用

@article{arxiv.2512.09215,
  title  = {View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs},
  author = {Yuanyuan Liu and Haiyang Mei and Dongyang Zhan and Jiayue Zhao and Dongsheng Zhou and Bo Dong and Xin Yang},
  journal= {arXiv preprint arXiv:2512.09215},
  year   = {2025}
}