CorrCLIP:重建 CLIP 中补丁相关性用于开放词汇语义分割
计算机视觉与模式识别
2025-08-04 v3
摘要
开放词汇语义分割旨在为每个像素分配语义标签,而不受预定义类别集合的限制。虽然对比语言-图像预训练 (CLIP) 在零样本分类中表现出色,但由于 patch correlations 不一致,难以将图像补丁与类别嵌入对齐。这一研究揭示了类间相关性是损害 CLIP 分割性能的主要原因。因此,我们提出了 CorrCLIP,通过重建 patch correlations 的范围和值来解决这一问题。具体而言,CorrCLIP 利用 Segment Anything Model (SAM) 定义 patch 交互的范围,从而减少类间相关性。为缓解 SAM 生成的掩码可能包含来自不同类的 patch 的问题,CorrCLIP 引入自监督模型来计算连贯的相似性值,以抑制类间相关性的权重。此外,我们引入两个额外的分支来加强 patch 特征的空间细节和语义表示。最后,我们使用 SAM 生成的掩码更新分割图,以提高空间一致性。基于 patch 相关性、特征表示和分割图的改进,CorrCLIP 在八个基准数据集上实现了优异性能。代码已公开:https://github.com/zdk258/CorrCLIP。
引用
@article{arxiv.2411.10086,
title = {CorrCLIP: Reconstructing Patch Correlations in CLIP for Open-Vocabulary Semantic Segmentation},
author = {Dengke Zhang and Fagui Liu and Quan Tang},
journal= {arXiv preprint arXiv:2411.10086},
year = {2025}
}
备注
Accepted to ICCV 2025 Oral