探索 CLIP 在训练免费开放词汇语义分割中的潜力
计算机视觉与模式识别
2024-07-12 v1
摘要
CLIP 作为一种视觉语言模型,已通过其零样学习能力显著推动了开放词汇语义分割 (Open-Vocabulary Semantic Segmentation, OVSS)。尽管取得了成功,但其初始以图像级对齐进行训练的特性,导致在需要详细局部上下文的任务中表现受限。我们的研究深入分析了 CLIP [CLS] 标记对 patch 特征相关性的影响,揭示了“全局” patch 的主导地位阻碍了局部特征的判别。为此,我们提出了 CLIPtrase,一种创新的训练免费语义分割策略,通过对 patch 之间的自相关进行校准,以增强局部特征的感知能力。该方法在分割精度和跨对象语义连贯性方面均实现显著提升。实验表明,我们在 9 个分割基准数据集上相较于 CLIP 平均提升了 22.3%,超越了现有的各类训练免费方法。代码已公开于:https://github.com/leaves162/CLIPtrase。
引用
@article{arxiv.2407.08268,
title = {Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation},
author = {Tong Shao and Zhuotao Tian and Hang Zhao and Jingyong Su},
journal= {arXiv preprint arXiv:2407.08268},
year = {2024}
}
备注
ECCV24 accepted