CLIPer:层次化提升 CLIP 空间表征用于开放词汇语义分割
计算机视觉与模式识别
2024-11-22 v1
摘要
对比式语言-图像预训练 (CLIP) 在各种图像级任务上展现出强大的零样本分类能力,推动了研究者尝试在无需额外训练的情况下将 CLIP 应用于像素级开放词汇语义分割。其核心在于改进图像级 CLIP 的空间表征,例如用最后一层的自注意力图替换自注意力图或基于视觉基础模型的注意力图。本文提出了名为 CLIPer 的一种新型层次化框架,用于层次化提升 CLIP 的空间表征。我们的方法包括一个早期层融合模块和一个细粒度补偿模块。我们观察到,早期层的嵌入和注意力图可以保留空间结构信息。基于此,我们设计了早期层融合模块以生成更具空间一致性的分割图。随后,我们采用细粒度补偿模块利用扩散模型的自注意力图来补偿局部细节。我们在七个语义分割数据集上进行实验。我们的方法在这些数据集上实现了最先进的性能。例如,使用 ViT-L,CLIPer 在 VOC 和 COCO Object 上的 mIoU 分别为 69.8% 和 43.3%,分别超越 ProxyCLIP 9.2% 和 4.1%。
引用
@article{arxiv.2411.13836,
title = {CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation},
author = {Lin Sun and Jiale Cao and Jin Xie and Xiaoheng Jiang and Yanwei Pang},
journal= {arXiv preprint arXiv:2411.13836},
year = {2024}
}
备注
Homepange and code: https://linsun449.github.io/cliper