中文

PosSAM:通用开源分割的全景模型

计算机视觉与模式识别 2024-03-15 v1

摘要

本文提出一种开放词汇全景分割模型,有效地在 Segment Anything Model (SAM) 与视觉语言 CLIP 模型的框架中进行端到端集成。虽然 SAM 在生成带空间感知的掩码方面表现出色,但其解码器在识别对象类别信息方面不足,且倾向于在没有额外指导的情况下过度分割。现有方法通过多阶段技术和使用单独模型生成类别感知提示(如边界框或分割掩码)来解决此限制。我们提出的方法 PosSAM 是一种端到端模型,利用 SAM 的空间丰富特征产生实例感知掩码,并利用 CLIP 的语义判别特征实现有效的实例分类。具体而言,我们针对 SAM 和类 aware CLIP 特征提出一种新颖的局部判别池化 (LDP) 模块,用于无偏的开放词汇分类。此外,我们引入一种掩码感知选择性混合 (MASE) 算法,在推理过程中自适应地增强生成掩码的质量并提升开放词汇分类性能。我们进行了大量实验,表明该方法在多个数据集上具有强大的泛化能力,实现了与 SOTA 开放词汇全景分割方法相比的显著性能提升。在 COCO 到 ADE20K 和 ADE20K 到 COCO 的设置下,PosSAM 分别比以前的 SOTA 方法高出 2.4 PQ 和 4.6 PQ。项目网站: https://vibashan.github.io/possam-web/。

关键词

引用

@article{arxiv.2403.09620,
  title  = {PosSAM: Panoptic Open-vocabulary Segment Anything},
  author = {Vibashan VS and Shubhankar Borse and Hyojin Park and Debasmit Das and Vishal Patel and Munawar Hayat and Fatih Porikli},
  journal= {arXiv preprint arXiv:2403.09620},
  year   = {2024}
}