中文

开放词汇 SAM3D:面向无训练的 3D 场景理解

计算机视觉与模式识别 2024-09-06 v3

摘要

开放词汇 3D 场景理解是该领域的一个重大挑战。最近的研究尝试将视觉语言模型中嵌入的知识从 2D 域迁移到 3D 域。然而,这些方法通常需要特定 3D 场景数据集中的先验知识,限制了其在开放世界场景中的适用性。Segment Anything Model (SAM) 展示出了惊人的零样素材分割能力,促使我们调查其在无需训练的情况下理解 3D 场景的潜力。本文介绍了 OV-SAM3D,这是一个无训练方法,包含一种通用框架用于理解开放词汇 3D 场景。该框架设计用于对任何 3D 场景进行理解,而无需了解该场景的先验知识。具体而言,我们的方法由两个关键子模块组成:首先,我们通过生成作为初始 3D 提示的超点来启动过程,并利用来自 SAM 的分割掩码对这些提示进行细化。此外,我们随后将专门设计的重叠得分表与来自 Recognize Anything Model (RAM) 的开放标签集成,以产生带有开放世界标签的最终 3D 实例。在 ScanNet200 和 nuScenes 数据集上的经验评估表明,我们的方法在未知开放世界环境中优于现有的开放词汇方法。

关键词

引用

@article{arxiv.2405.15580,
  title  = {Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding},
  author = {Hanchen Tai and Qingdong He and Jiangning Zhang and Yijie Qian and Zhenyu Zhang and Xiaobin Hu and Xiangtai Li and Yabiao Wang and Yong Liu},
  journal= {arXiv preprint arXiv:2405.15580},
  year   = {2024}
}

备注

Project page: https://hithqd.github.io/projects/OV-SAM3D