中文

SAMPro3D:在三维空间中定位 SAM 提示以实现零样本实例分割

计算机视觉与模式识别 2025-02-05 v2

摘要

我们提出 SAMPro3D,用于三维场景的零样本实例分割。给定三维点云及三维场景的多帧带位姿 RGB-D 图像,我们的方法通过将预训练的 Segment Anything Model (SAM) 应用于二维帧来分割三维实例。我们的核心思想是在三维空间中定位 SAM 提示,使其投影的像素提示在各帧间对齐,从而保证 SAM 预测掩码的视角一致性。此外,我们建议根据所有视角下 SAM 预测掩码的信息从初始提示集中筛选提示,从而提升整体性能。我们进一步提出,若不同提示分割的是同一三维实例的不同表面部分,则将其合并,以获得更全面的分割。值得注意的是,我们的方法无需任何额外训练。在多个基准上的大量实验表明,与以往的零样本或全监督方法相比,我们的方法取得了相当或更优的性能,且在许多情况下超越了人工标注。此外,由于我们的细粒度预测在现有数据集中往往缺乏标注,我们提出了 ScanNet200-Fine50 测试数据,该数据基于 ScanNet200 数据集的 50 个场景提供了细粒度标注。项目页面可通过 https://mutianxu.github.io/sampro3d/ 访问。

关键词

引用

@article{arxiv.2311.17707,
  title  = {SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation},
  author = {Mutian Xu and Xingyilang Yin and Lingteng Qiu and Yang Liu and Xin Tong and Xiaoguang Han},
  journal= {arXiv preprint arXiv:2311.17707},
  year   = {2025}
}

备注

To be appear in 3DV2025. Project page: https://mutianxu.github.io/sampro3d/