中文

CLIP-DINOiser:教 CLIP 几个 DINO 技巧以实现开放词汇语义分割

计算机视觉与模式识别 2024-03-28 v2

摘要

流行的 CLIP 模型凭借其与任意文本提示的无缝交互,展现出了令人印象深刻的零样本能力。然而,由于缺乏空间感知能力,如果不经过额外的微调步骤(这通常需要使用标注,且可能抑制其原有的开放词汇特性),它无法适用于密集计算机视觉任务,例如语义分割。与此同时,自监督表示方法已经证明,在无需人工标注或显式监督的情况下即可表现出良好的定位特性。在本工作中,我们取两者之长,提出了一种不需要任何标注的开放词汇语义分割方法。我们提出,通过整合从自监督特征中提取的定位先验,来局部改进密集 MaskCLIP 特征(该特征是通过对 CLIP 最后一个池化层的简单修改计算得到的)。通过这样做,我们极大地提高了 MaskCLIP 的性能并产生了平滑的输出。此外,我们展示了所使用的自监督特征特性可以直接从 CLIP 特征中学习得到。我们的方法 CLIP-DINOiser 在推理时仅需 CLIP 的单次前向传播和两个轻量卷积层,无需额外监督或额外内存,并在 COCO、Pascal Context、Cityscapes 和 ADE20k 等具有挑战性的细粒度基准上达到了 SOTA 结果。复现我们结果的代码可在 https://github.com/wysoczanska/clip_dinoiser 获取。

关键词

引用

@article{arxiv.2312.12359,
  title  = {CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation},
  author = {Monika Wysoczańska and Oriane Siméoni and Michaël Ramamonjisoa and Andrei Bursuc and Tomasz Trzciński and Patrick Pérez},
  journal= {arXiv preprint arXiv:2312.12359},
  year   = {2024}
}