中文

SAMCLR:利用 SAM 进行视图采样在复杂场景上的对比预训练

计算机视觉与模式识别 2023-10-31 v2

摘要

在计算机视觉中,自监督对比学习强制同一图像不同视图之间具有相似的表征。预训练通常在图像分类数据集(如 ImageNet)上进行,这类图像主要包含单一类别的物体。然而,当处理包含多个物体的复杂场景时,同一图像的若干视图代表同一物体类别的可能性变得非常低。在此背景下,我们提出 SAMCLR,一种 SimCLR 的附加模块,它利用 SAM 将图像分割为语义区域,然后从同一区域中采样两个视图。初步实验结果表明,在 Cityscapes 和 ADE20K 上预训练,随后在 CIFAR-10、STL10 和 ImageNette 上评估分类任务时,SAMCLR 至少与 SimCLR 表现相当,且大多数情况下不仅显著优于 SimCLR,也优于 DINO 和 MoCo。

关键词

引用

@article{arxiv.2310.14736,
  title  = {SAMCLR: Contrastive pre-training on complex scenes using SAM for view sampling},
  author = {Benjamin Missaoui and Chongbin Yuan},
  journal= {arXiv preprint arXiv:2310.14736},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023 Workshop on SSL