基于无训练自校准CLIP的训练免费开放词汇分割
计算机视觉与模式识别
2026-03-27 v3
摘要
近期预训练视觉语言模型如CLIP的进展,使开放词汇分割任务成为可能。CLIP在需要综合图像理解的各种下游任务中展现出惊人的零样性能。然而,由于图像级别的对比学习和完全全局特征交互,基于ViT的CLIP在捕获局部细节方面存在困难,导致在分割任务中表现不佳。我们的分析表明,基于ViT的CLIP在前向过程中会出现异常标记,这些标记会吸引正常块标记的不成比例注意,从而削弱了空间感知能力。为了解决这一问题,我们提出了自校准CLIP(SC-CLIP),一种无需训练的方法,可在不引入新参数或依赖额外主干网络的情况下校准CLIP以生成更细致的表征。具体来说,我们从两个互补的角度缓解异常标记对正常标记的负面影响:首先,我们显式识别异常标记并基于局部上下文进行替换;其次,通过增强特征可区分性和注意力相关性,降低异常标记对正常标记的影响,利用CLIP中中间层特征内在的语义一致性。在此基础上,我们引入一种双传递策略,在无训练设置下有效地整合多级别特征,以丰富局部细节。总而言之,这些策略提高了CLIP特征表征的细粒度和语义一致性。实验结果表明,SC-CLIP的有效性,在所有数据集上实现了最先进的性能,显著优于先前方法9.5%。值得注意的是,SC-CLIP将vanilla CLIP ViT-L/14的性能提升了6.8倍。我们的源代码可在https://github.com/SuleBai/SC-CLIP获取。
引用
@article{arxiv.2411.15869,
title = {Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation},
author = {Sule Bai and Yong Liu and Yifei Han and Haoji Zhang and Yansong Tang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2411.15869},
year = {2026}
}
备注
Accepted by IEEE TIP