中文

ReCLIP++:修正CLIP偏见用于无监督语义分割

计算机视觉与模式识别 2026-05-11 v4

摘要

最近的工作利用CLIP执行具有挑战性的无监督语义分割任务,其中仅提供无标注图像。然而,我们观察到当将CLIP应用于这种像素级理解任务时,会出现明显的偏见(包括类别偏好偏见和空间偏好偏见)。以往的工作没有显式建模这些偏见,这严重限制了分割性能。本文提出显式建模并修正CLIP中存在的偏见,以促进无监督语义分割。具体来说,我们设计了一个可学习的“参考”特征来编码类别偏好偏见,以及视觉Transformer中位置嵌入的投影来编码空间偏好偏见。为避免干扰,两种偏见分别编码为不同的特征,即参考特征和位置特征。通过参考特征与位置特征的矩阵乘法,生成一个偏见logit图,显式表示两种偏见。然后通过逐元素减法修正CLIP的logits。为了使修正结果更平滑且更具上下文信息,我们设计了一个掩码解码器,以CLIP特征和修正后的logits为输入,借助Gumbel-Softmax操作输出修正后的分割掩码。此外,我们引入了一种基于掩码视觉特征和不同类别文本特征的对比损失,使偏见建模和修正过程有效且有意义。在PASCAL VOC、PASCAL Context、ADE20K、Cityscapes和COCO Stuff等多个基准上的大量实验表明,我们的方法优于现有最先进技术。代码可在https://github.com/dogehhh/ReCLIP获取。

关键词

引用

@article{arxiv.2408.06747,
  title  = {ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation},
  author = {Jingyun Wang and Guoliang Kang},
  journal= {arXiv preprint arXiv:2408.06747},
  year   = {2026}
}

备注

Extended version of our CVPR 24 paper, accepted by IJCV 2025