DeCLIP:基于解耦提示的 CLIP 多标签类递增学习
计算机视觉与模式识别
2026-03-09 v2
摘要
多标签类递增学习(MLCIL)在不断扩展标签空间的同时进行多类识别,容易出现灾�性遗忘和高假阳性率(FPR)。将 CLIP 扩展到 MLCIL 并不容易,因为共现类别违反了 CLIP 的单图-文本对齐范式,任务级部分标注会导致高 FPR。我们提出 DeCLIP,一个无需回放、参数高效的框架,通过一种一对一的类别特定提示方案解耦 CLIP 表示。通过为每个类别分配其自身的提示空间,DeCLIP 可防止标签之间的语义混淆,并将多标签图像解耦为与 CLIP 预训练相容的单类视图。所学提示词作为知识锚点被保存下来,以无回放方式缓解灾难性遗忘。我们进一步引入自适应相似度调制(AST),一种基于任务的策略,用于无需数据集特定调优地抑制 FPR。在 MS-COCO 和 PASCAL VOC 上的实验表明,DeCLIP 能以最小的可训练参数 consistently 超越先前方法。
引用
@article{arxiv.2509.23335,
title = {DeCLIP: Decoupled Prompting for CLIP-based Multi-Label Class-Incremental Learning},
author = {Kaile Du and Zihan Ye and Junzhou Xie and Yixi Shen and Yuyang Li and Fuyuan Hu and Ling Shao and Guangcan Liu and Joost van de Weijer and Fan Lyu},
journal= {arXiv preprint arXiv:2509.23335},
year = {2026}
}