中文

基于视觉语言模型的零样本 3D 视觉定位

计算机视觉与模式识别 2025-05-29 v1 机器人学

摘要

3D 视觉定位 (3DVG) 旨在利用自然语言描述在 3D 场景中定位目标物体,从而实现增强现实和机器人技术等下游应用。现有方法通常依赖于带有标注的 3D 数据和预定义类别,这限制了其在开放世界环境中的可扩展性。我们提出了 SeeGround,这是一个零样本 3DVG 框架,它利用 2D 视觉语言模型 (VLMs) 来规避对 3D 专用训练的需求。为了弥合模态差距,我们引入了一种混合输入格式,将查询对齐的渲染视图与空间增强的文本描述相配对。我们的框架包含两个核心组件:一个根据查询动态选择最佳视角的透视自适应模块,以及一个融合视觉和空间信号以增强定位精度的融合对齐模块。在 ScanRefer 和 Nr3D 上的广泛评估证实,SeeGround 相比现有的零样本基线取得了显著提升——分别优于它们 7.7% 和 7.1%——甚至可与完全监督的方法相媲美,展现了在挑战性条件下的强大泛化能力。

关键词

引用

@article{arxiv.2505.22429,
  title  = {Zero-Shot 3D Visual Grounding from Vision-Language Models},
  author = {Rong Li and Shijie Li and Lingdong Kong and Xulei Yang and Junwei Liang},
  journal= {arXiv preprint arXiv:2505.22429},
  year   = {2025}
}

备注

3D-LLM/VLA @ CVPR 2025; Project Page at https://seeground.github.io/