中文

重构 CLIP 全局知识:面向训练-free 开放词汇语义分割的 GCLIP

机器学习 2026-05-12 v3

摘要

最近的研究修改 CLIP 以实现训练-free 方式的开放词汇语义分割 (TF-OVSS)。在基础 CLIP 中,patch 级图像表征主要编码同质的图像级属性,这阻碍了 CLIP 应用于密集预测任务。之前的 TF-OVSS 方法通过使每个 patch 主要关注自身或其相邻 patch 于狭窄局部窗口内的注意力,牺牲了全局性来增强 CLIP 特征的局部性。随着这些修改,CLIP 汇聚全局上下文信息的能力被大幅削弱。不同地,本文重新思考了 CLIP 编码的全局知识,提出 GCLIP 以回答如何提取和利用 CLIP 对 TF-OVSS 有益的全局知识。由于每个 patch 的最终表征由注意力权重和 Value 嵌入决定,我们提出重新塑形最后一层注意力和 Value 嵌入,以整合有用的全局上下文进入最终特征。首先,我们旨在使最后一层注意力具备图像级属性,同时不引入 patch 间的同质注意力模式。为实现此目标,我们融合来自全局 token 产生块的注意力与 Query-Query 注意力。其次,我们旨在使最后一层注意力模块的 Value 嵌入在语义上更具关联性。为实现此目标,我们设计了一种新颖的通道抑制策略。在五个标准基准上的大量实验表明,我们的方法 consistently 优于之前的最先进方法。

关键词

引用

@article{arxiv.2502.06818,
  title  = {Rethinking the Global Knowledge of CLIP in Training-Free Open-Vocabulary Semantic Segmentation},
  author = {Jingyun Wang and Cilin Yan and Guoliang Kang},
  journal= {arXiv preprint arXiv:2502.06818},
  year   = {2026}
}

备注

TMM 2026