面向 CLIP 基于类增量学习的外部知识注入
计算机视觉与模式识别
2025-07-25 v2 机器学习
摘要
类增量学习(CIL)使学习系统能够持续适应不断演变的数据流。随着预训练技术的发展,利用预训练视觉语言模型(如 CLIP)为 CIL 提供了具有前景的起点。然而,CLIP 通过将视觉嵌入匹配到类别名称来做出决策,忽略了通过语言传递的丰富语境信息。例如,"猫"这一概念可分解为尾巴、毛皮和面部等特征用于识别。此外,由于模型持续更新,这些详细特征在 CIL 中会被覆盖,需依赖外部知识进行补偿。本文提出了一种针对 CLIP 基于类增量学习的外部知识注入方法,称为 ENGINE。为增强数据外部的知识传递,我们提出了双支路注入调优框架,对编码来自视觉和文本两种模态的丰富信息。视觉支路通过数据增强丰富视觉特征,而文本支路则利用 GPT-4 重写判别性描述符。除此项即时知识注入外,我们还实现了通过在推理期间对预测结果进行重新排序的后期调优。凭借注入的知识,模型能够更好地捕获下游任务中具有信息量的特征,以应对数据演变。广泛实验表明,ENGINE 在类增量学习中实现了最新表现。代码已公开:https://github.com/LAMDA-CL/ICCV25-ENGINE
引用
@article{arxiv.2503.08510,
title = {External Knowledge Injection for CLIP-Based Class-Incremental Learning},
author = {Da-Wei Zhou and Kai-Wen Li and Jingyi Ning and Han-Jia Ye and Lijun Zhang and De-Chuan Zhan},
journal= {arXiv preprint arXiv:2503.08510},
year = {2025}
}
备注
Accepted to ICCV 2025. Code is available at: https://github.com/LAMDA-CL/ICCV25-ENGINE