中文

SPDA-SAM:面向实例分割的自我提示深度感知分割模型

计算机视觉与模式识别 2026-02-09 v1

摘要

最近,Segment Anything Model (SAM) 在 various 实例分割任务中展现出强大的通用性。然而,其性能严重依赖于 manual 提示的质量。此外,实例分割方法通常使用的 RGB 图像本身缺乏深度信息,导致其 perceive 空间结构和 delineate 物体边界的能力受到限制。为此,我们提出了用于实例分割的自我提示深度感知 SAM (SPDA-SAM)。具体而言,我们设计了语义-空间自我提示模块 (SSSPM),从 SAM 的图像编码器和 mask 解码器中分别提取语义和空间提示。进一步,我们引入了粗到细 RGB-D 融合模块 (C2FFM),其中融合了来自单目 RGB 图像和其估计深度图的特征。特别地,深度图中的结构信息用于提供粗粒度指导以引导特征融合,而深度图中的局部变化被编码以融合细粒度特征表示。鉴于 SAM 尚未以自我提示和深度感知的方式进行探索,我们的方法具有创新性。实验结果表明,我们的 SPDA-SAM 在 twelve 个不同数据集上超越了其 state-of-the-art 对手。这一鼓舞人心的结果归因于自我提示的引导以及粗到细 RGB-D 融合操作弥补了空间信息丢失。

关键词

引用

@article{arxiv.2602.06335,
  title  = {SPDA-SAM: A Self-prompted Depth-Aware Segment Anything Model for Instance Segmentation},
  author = {Yihan Shang and Wei Wang and Chao Huang and Xinghui Dong},
  journal= {arXiv preprint arXiv:2602.06335},
  year   = {2026}
}