开放词汇 SAM3D:面向无训练的 3D 场景理解
计算机视觉与模式识别
2024-09-06 v3
摘要
开放词汇 3D 场景理解是该领域的一个重大挑战。最近的研究尝试将视觉语言模型中嵌入的知识从 2D 域迁移到 3D 域。然而,这些方法通常需要特定 3D 场景数据集中的先验知识,限制了其在开放世界场景中的适用性。Segment Anything Model (SAM) 展示出了惊人的零样素材分割能力,促使我们调查其在无需训练的情况下理解 3D 场景的潜力。本文介绍了 OV-SAM3D,这是一个无训练方法,包含一种通用框架用于理解开放词汇 3D 场景。该框架设计用于对任何 3D 场景进行理解,而无需了解该场景的先验知识。具体而言,我们的方法由两个关键子模块组成:首先,我们通过生成作为初始 3D 提示的超点来启动过程,并利用来自 SAM 的分割掩码对这些提示进行细化。此外,我们随后将专门设计的重叠得分表与来自 Recognize Anything Model (RAM) 的开放标签集成,以产生带有开放世界标签的最终 3D 实例。在 ScanNet200 和 nuScenes 数据集上的经验评估表明,我们的方法在未知开放世界环境中优于现有的开放词汇方法。
引用
@article{arxiv.2405.15580,
title = {Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding},
author = {Hanchen Tai and Qingdong He and Jiangning Zhang and Yijie Qian and Zhenyu Zhang and Xiaobin Hu and Xiangtai Li and Yabiao Wang and Yong Liu},
journal= {arXiv preprint arXiv:2405.15580},
year = {2024}
}
备注
Project page: https://hithqd.github.io/projects/OV-SAM3D