开放词汇三维实例分割的零样本双路径集成框架
计算机视觉与模式识别
2024-08-19 v1
摘要
开放词汇三维实例分割超越了传统封闭词汇方法,能够在现实场景中识别先前见过和未见过的对象。它利用双模态方法,同时使用三维点云和二维多视角图像生成类别无关的目标掩码提议。此前的工作主要集中于增强三维掩码提议模型;因此,来自二维到三维的关联信息未被充分利用。这种对三维数据的偏向虽然在熟悉室内物体上有效,但限制了系统对新颖和多样化物体类型的适应性,因为二维模型提供了更大的效用。为弥补这一差距,我们提出了零样本双路径集成框架,同等重视三维和二维模态的贡献。我们的框架包含三个组件:三维路径、二维路径和双路径集成。三维路径使用预训练三维模型从三维点云数据生成空间精确的常见室内物体类别无关掩码提议,而二维路径利用预训练开放词汇实例分割模型从多视角RGB-D图像识别多样化的目标提议。在双路径集成中,我们的条件集成过程分两个阶段运行,自适应地过滤和合并两条路径的提议。该过程协调输出提议以增强分割能力。我们的框架以零样本方式使用预训练模型,是模型无关的,在已见和未见数据上均表现出优越性能,这由在ScanNet200上的全面评估和ARKitScenes数据集上的定性结果所证实。
引用
@article{arxiv.2408.08591,
title = {Zero-Shot Dual-Path Integration Framework for Open-Vocabulary 3D Instance Segmentation},
author = {Tri Ton and Ji Woo Hong and SooHwan Eom and Jun Yeop Shim and Junyeong Kim and Chang D. Yoo},
journal= {arXiv preprint arXiv:2408.08591},
year = {2024}
}
备注
OpenSUN 3D: 2nd Workshop on Open-Vocabulary 3D Scene Understanding (CVPR 2024)