中文

超越 CLIP 通用性:反向遗忘适配器用于视觉语言模型持续学习

计算机视觉与模式识别 2025-05-13 v1

摘要

本研究旨在解决多域任务增量学习(multi-domain task incremental learning, MTIL)的问题,这要求视觉语言模型(VLMs)在持续获取新知识的同时维持其固有的零样子识别能力。现有方法将未知域样本的测试委托给原始 CLIP,仅防止模型零样子能力退化,却未能进一步提升 VLM 的通用性。为此,我们提出一种新型 MTIL 框架,命名为 AFA,由两个核心模块构成:(1) 反向遗忘适配器(against forward-forgetting adapter),为每个增量任务中的数据集学习任务不变信息,增强 VLMs 的零样子识别能力;(2) 反向遗忘适配器(against backward-forgetting adapter),强化 VLMs 的少样本学习能力,同时支持增量学习。广泛的实验表明,AFA 方法在现有最新方法上显著优于,尤其在少样本 MTIL 任务中表现更佳,甚至超越了 CLIP 本身的零样子性能,显示出更好的迁移能力。代码已包含在补充材料中。

关键词

引用

@article{arxiv.2505.07690,
  title  = {Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models},
  author = {Songlin Dong and Chenhao Ding and Jiangyang Li and Jizhou Han and Qiang Wang and Yuhang He and Yihong Gong},
  journal= {arXiv preprint arXiv:2505.07690},
  year   = {2025}
}