中文

基于视觉语言模型的非线性多适配器简单高效增量学习框架

计算机视觉与模式识别 2026-03-20 v2 人工智能

摘要

增量学习(Incremental Learning, IL)旨在学习新任务的同时保留先前获取的知识。将预训练视觉语言模型的零样本学习能力集成到增量学习方法中已取得显著进展。然而,这些方法面临三个主要挑战:(1)需要提高训练效率;(2)依赖存储先前数据的记忆库;(3)需要强大的主干网络来增强模型能力。本文提出SimE,一个简单高效的框架,采用专为增量学习任务设计的适配器视觉语言模型。我们报告了一个显著现象:适配器连接数量与模型增量学习能力之间存在非线性相关性。在 transformer 块之间增加适配器连接可提升模型性能,但在较小的增量步骤中增加 transformer 块内的适配器连接并不能提升,甚至可能损害模型的增量学习能力。大量实验结果表明,SimE 在 TinyImageNet 上比传统方法提升了 9.6%,在 CIFAR-100 上比其他基于 CLIP 的方法提升了 5.3%。此外,我们系统性地研究了如何更好地利用 CLIP 的零-shot 能力。我们建议替换 SimE 的编码器为在更大数据集(如 LAION2B)上训练的 CLIP 模型(如 ViT-L/14)。

关键词

引用

@article{arxiv.2603.11211,
  title  = {A Simple Efficiency Incremental Learning Framework via Vision-Language Model with Nonlinear Multi-Adapters},
  author = {Haihua Luo and Xuming Ran and Jiangrong Shen and Timo Hämäläinen and Zhonghua Chen and Qi Xu and Fengyu Cong},
  journal= {arXiv preprint arXiv:2603.11211},
  year   = {2026}
}