中文

保持 CLIP 基于类递增学习中的跨模态一致性

计算机视觉与模式识别 2025-11-17 v1

摘要

类递增学习 (CIL) 使模型能够在不忘记先前知识的前提下连续学习新的类别。虽然近期的视觉语言模型如 CLIP 在跨域泛化方面表现出色,但将其扩展到持续学习场景仍具有挑战性。特别是,为新引入的类别学习任务特定的软提示常常导致分类器偏差,因为当先前数据不可用时,文本原型会对最近的类别过拟合。本文提出了 DMC,一个简单而有效的 CLIP 基于 CIL 的两阶段框架,解耦了视觉编码器的适应与文本软提示的优化。每个阶段在另一模态冻结的情况下进行训练,允许一个模态作为稳定的语义锚点,为另一个模态保留跨模态对齐。此外,当前的 CLIP 基于 CIL 方法通常存储类-wise 高斯统计用于生成式重放,但忽略了当视觉编码器随时间更新时出现的分布漂移。为解决此问题,我们引入了 DMC-OT,一个包含基于最优输运引导的校准策略,以整合演化编码器中的记忆统计,并包含增强类别间可分离性的任务特定提示设计。针对 CIFAR-100、Imagenet-R、CUB-200 和 UCF-101 进行的大量实验表明,DMC 和 DMC-OT 均实现了最先进的性能,DMC-OT 进一步将准确率提高平均 1.80%。

关键词

引用

@article{arxiv.2511.10974,
  title  = {Preserving Cross-Modal Consistency for CLIP-based Class-Incremental Learning},
  author = {Haoran Chen and Houze Xu and Micah Goldblum and Daoguo Dong and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2511.10974},
  year   = {2025}
}