中文

SPAZER:基于空间-语义渐进推理的零样本三维视觉定位代理

计算机视觉与模式识别 2025-06-30 v1

摘要

三维视觉定位(3DVG)旨在基于自然语言查询在三维场景中定位目标对象。为缓解对高成本三维训练数据的依赖,近期研究探索了利用预训练大语言模型(LLM)和视觉-语言模型(VLM)的广泛知识和强大推理能力进行零样本3DVG。然而,现有方法倾向于强调要么空间(基于三维的),要么语义(基于二维的)理解,限制其在复杂现实应用中的效果。本文引入SPAZER——一个驱动VLM的代理,将两种模态在渐进推理框架中结合。它首先对场景进行整体分析,并生成最佳视点下的三维渲染。基于此,执行锚点引导的候选筛选,以进行潜在对象的粗略定位。进而利用检索到的相关二维摄像图像,高效进行三维-二维联合决策,以确定最佳匹配对象。通过桥接空间与语义推理神经流,SPAZER在无需训练三维标注数据的情况下实现了稳健的零样本定位。在ScanRefer和Nr3D基准上进行的广泛实验表明,SPAZER显著优于以往的最新零样本方法,准确率提升了9.0%和10.9%。

关键词

引用

@article{arxiv.2506.21924,
  title  = {SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding},
  author = {Zhao Jin and Rong-Cheng Tu and Jingyi Liao and Wenhao Sun and Xiao Luo and Shunyu Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2506.21924},
  year   = {2025}
}