基于 CLIP 的类递增学习中的属性抽取与聚合: AREA
计算机视觉与模式识别
2026-05-28 v1 机器学习
摘要
类递增学习 (Class-Incremental Learning, CIL) 是构建现实世界学习系统的重要任务。在 CLIP 基础的 CIL 中,模型通过比较从模板提示(例如 "a photo of a [CLASS]" )获取的视觉和文本嵌入之间的相似性来进行分类。这种看似单一的匹配过程可以分解为两个概念上独立的阶段:属性抽取和属性聚合。例如,模型可能通过 fur texture 和 whiskers 等属性识别猫。当学习新的类别(如汽车)时,模型必须抽取额外的属性(如轮子)并调整它们在共享表示空间中的聚合方式。然而,由于仅可获得当前任务的数据,增量更新可能使属性抽取和聚合都偏向新类别,导致灾难性遗忘。因此,我们提出 AREA 用于 CLIP 基础 CIL 中的属性抽取和聚合。为稳定抽取,我们通过主曲线分析将类级视觉和文本属性锚定在球面嵌入空间上。为稳定聚合,我们学习轻量级任务特定专家,采用评分和残差细化,并受变分信息瓶颈目标正则化。在推理期间,我们通过最优传输对任务属性流形进行路由,以获得更简洁的预测。实验表明,AREA 在所有基准测试上均一致优于 SOTA 方法。代码已公开于 https://github.com/LAMDA-CL/ICML2026-AREA。
引用
@article{arxiv.2605.28809,
title = {AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning},
author = {Zhen-Hao Xie and Yu-Cheng Shi and Da-Wei Zhou},
journal= {arXiv preprint arXiv:2605.28809},
year = {2026}
}
备注
Accepted to ICML 2026. Code is available at https://github.com/LAMDA-CL/ICML2026-AREA