中文

基于 SLIP(SAM+CLIP)的零样文本情境对象分割

计算机视觉与模式识别 2024-05-27 v1 人工智能

摘要

我们提出了 SLIP(SAM+CLIP),一种增强的零样对象分割架构。SLIP 将 Segment Anything Model(SAM)\cite{kirillov2023segment} 与 Contrastive Language-Image Pretraining(CLIP)\cite{radford2021learning} 结合在一起。通过将文本提示整合到 SAM 中,SLIP 实现了无需针对特定类别或类别进行先验训练即可进行对象分割。我们在 Pokemon 数据集上微调 CLIP,使其学习有意义的图像-文本表示。SLIP 能够基于文本提示中提供的上下文信息识别并分割图像中的对象,扩展了 SAM 在通用对象分割方面的能力。我们的实验表明,SLIP 架构在基于文本线索对图像中的对象进行分割方面有效。将 CLIP 的文本-图像理解能力集成到 SAM 中,扩展了原始架构的能力,使其能够进行更具上下文感知的对象分割。

关键词

引用

@article{arxiv.2405.07284,
  title  = {Zero Shot Context-Based Object Segmentation using SLIP (SAM+CLIP)},
  author = {Saaketh Koundinya Gundavarapu and Arushi Arora and Shreya Agarwal},
  journal= {arXiv preprint arXiv:2405.07284},
  year   = {2024}
}

备注

5 pages, 3 figures