中文

SeeGround:零样态开词汇 3D 视觉 grounding

计算机视觉与模式识别 2025-05-30 v2 机器人学

摘要

3D 视觉 grounding(3DVG)旨在基于文本描述定位 3D 场景中的目标对象,是增强现实和机器人等应用的关键技术。传统 3DVG 方法依赖标注的 3D 数据集和预定义的对象类别,受限于可扩展性和适应性。为突破这些限制,我们引入 SeeGround——一个基于 2D 视觉语言模型(VLM)训练的零样态 3DVG 框架。SeeGround 将 3D 场景表示为查询对齐渲染图像与空间增强文本描述的混合形式,桥接了 3D 数据与 2D-VLM 输入格式之间的鸿沟。我们提出两个模块:视角适应模块,用于动态选择与查询相关的图像渲染视角;融合对齐模块,将 2D 图像与 3D 空间描述集成以增强目标定位。大量实验表明,我们的方法在 ScanRefer 和 Nr3D 上均显著优于现有零样态方法。值得注意的是,我们超越了弱监督方法,部分全监督方法, 在 ScanRefer 上超越前 SOTA 7.7%,在 Nr3D 上超越 7.1%,彰显了在复杂 3DVG 任务中的有效性。

关键词

引用

@article{arxiv.2412.04383,
  title  = {SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding},
  author = {Rong Li and Shijie Li and Lingdong Kong and Xulei Yang and Junwei Liang},
  journal= {arXiv preprint arXiv:2412.04383},
  year   = {2025}
}

备注

CVPR 2025; 21 pages, 10 figures, 10 tables; Code at https://seeground.github.io/