面向视觉-语言模型跨域判别性提升的持续学习
计算机视觉与模式识别
2024-12-19 v4
摘要
视觉-语言模型 (VLM) 的持续学习 (CL) 已克服了传统 CL 只关注以前遇到的类别的限制。在 VLM 的 CL 中,我们不仅需要防止在逐步学习的知识上发生灾难性遗忘,还要保持 VLM 的零样例能力。然而,现有方法需要额外的参考数据集来维持这种零样例能力,并依赖于域身份线索来对来自不同域的图像进行分类。在本研究中,我们提出了基于回归的分析性增量学习 (RAIL),该方法利用递归岭回归基适配器,以非遗忘方式从一序列域中学习,并通过将特征投影到更高维空间来解耦跨域相关性。配合训练自由的融合模块,RAIL在无需任何参考数据的情况下绝对保留了 VLM 在未见域上的零样例能力。此外,我们引入了跨域任务无关增量学习 (X-TAIL) 设置。在此设置下,CL 学习者需要从多个域中逐步学习,并在无任何域身份线索的情况下对来自seen 和 unseen 域的测试图像进行分类。我们理论证明了 RAIL 对逐步学习的域具有绝对记忆。在实验结果确认了 RAIL 在 X-TAIL 和现有多域任务增量学习设置下的领先性能。代码已发布于 https://github.com/linghan1997/Regression-based-Analytic-Incremental-Learning。
引用
@article{arxiv.2406.18868,
title = {Advancing Cross-domain Discriminability in Continual Learning of Vision-Language Models},
author = {Yicheng Xu and Yuxin Chen and Jiahao Nie and Yusong Wang and Huiping Zhuang and Manabu Okumura},
journal= {arXiv preprint arXiv:2406.18868},
year = {2024}
}
备注
Accepted by NeurIPS 2024