中文

魔鬼在物体边界:利用基础模型实现无标注实例分割

计算机视觉与模式识别 2024-04-19 v1

摘要

在大规模数据上预训练的基础模型在各种下游任务中展现了令人印象深刻的零样本能力。然而,在目标检测和实例分割这两个严重依赖大量人工标注的基本计算机视觉任务中,SAM和DINO等基础模型难以取得令人满意的性能。在本研究中,我们揭示了魔鬼在物体边界,即这些基础模型无法区分单个物体之间的边界。我们首次发现,从未接触过任何实例级标注的CLIP,在其特定中间层的聚类结果中能够提供高度有益且强大的实例级边界先验。基于这一令人惊讶的观察,我们提出了Zip\textbf{Zip},它在一个新颖的“先分类后发现”流程中整合了CLip\textbf{ip}和SAM,实现了无标注、复杂场景适用、开放词汇的目标检测和实例分割。我们的Zip在COCO数据集上将SAM的掩码AP显著提升了12.5%,并在各种设置(包括无训练、自训练和标签高效微调)中建立了最先进的性能。此外,无标注的Zip甚至在使用基础标注的最佳开放词汇目标检测器上达到了可比的性能。代码已发布在https://github.com/ChengShiest/Zip-Your-CLIP。

关键词

引用

@article{arxiv.2404.11957,
  title  = {The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models},
  author = {Cheng Shi and Sibei Yang},
  journal= {arXiv preprint arXiv:2404.11957},
  year   = {2024}
}

备注

ICLR2024, Code is released at https://github.com/ChengShiest/Zip-Your-CLIP