中文

解锁 CLIP 基于类递增学习的 patch 级特征

计算机视觉与模式识别 2026-05-14 v1

摘要

类递增学习(Class-Incremental Learning, CIL)使模型能够持续集成新知识,同时缓解灾难性遗忘。受 CLIP 卓越泛化能力的驱动,利用预训练视觉语言模型已成为 CIL 的主导范式。然而,当前工作主要聚焦于将全局图像嵌入(即 [CLS] 标记)与其对应的文本提示(即 [EOS] 标记)对齐。尽管表现良好,我们发现这些方法丢弃了 CLIP 编码器中固有的丰富 patch 级语义信息。例如,在识别兔子时,局部 patch 可能编码其独特线索,如长耳和蓬松尾巴,这些线索可为识别提供补充证据。基于上述观察,我们提出了 SPA(Semantic-guided Patch-level Alignment,语义引导的 patch 级对齐)用于 CLIP 基于 CIL 的方法,旨在唤醒 CLIP 中被忽视的局部表示。具体而言,对于每个类别,我们首先构建具有代表性和多样性的视觉样本,并将其输入到 GPT-5 作为视觉指导,以生成类别无关的语义描述。这些描述用于引导选择判别性的 patch 级视觉特征。基于这些选定的 patch,我们进一步采用最优输运将选定的 patch 标记与类别语义描述的语义标记对齐,实现结构化的跨模态对齐,从而提升识别效果。此外,我们引入任务特定的投影器以有效适应下游递增任务,并从存储的类别高斯统计中抽取伪特征以校准旧类别表示,从而缓解灾难性遗忘。大量实验表明,SPA 实现了最先进的性能。

关键词

引用

@article{arxiv.2605.13835,
  title  = {Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning},
  author = {Hao Sun and Zi-Jun Ding and Da-Wei Zhou},
  journal= {arXiv preprint arXiv:2605.13835},
  year   = {2026}
}