面向持续学习的视觉语言模型多阶段知识集成
计算机视觉与模式识别
2024-11-12 v1 机器学习
摘要
视觉语言模型(VLMs)预训练于大规模图像文本数据集,能够对看不见的数据实现零样例预测,但在特定未见任务上可能表现不佳。持续学习(CL)有助于VLMs在不进行联合训练的情况下有效适应新数据分布,但面临灾难性遗忘和泛化遗忘的挑战。尽管通过蒸馏方法取得了显著进展,但存在两个严重局限:一个是流行采用的单教师范式未能传递全面知识,另一个是现有方法不充分利用原始训练数据集中的多模态信息,转而依赖额外数据进行蒸馿,这增加了计算和存储开销。为缓解这两个局限,我们基于知识集成理论(KIT),提出一种多阶段知识集成网络(MulKI),以模拟人类学习过程来进行蒸馿方法。MulKI 通过四个阶段实现:包括挖掘想法、添加新想法、区分想法和建立联系。在这四个阶段,我们首先利用原型在不同模态之间进行对齐,挖掘跨模态知识,然后通过构建原型的细粒度内部和跨模态关系来添加新知识。随后,对来自两个教师模型的知识进行自适应区分和重新加权。最后,我们在模型之间进行内部和跨任务的连接,整合前导和新知识。我们的方法在保持零样例能力的同时,支持跨 diverse 下游任务的持续学习,展示了其在适应不断变化的数据分布方面的潜力。
引用
@article{arxiv.2411.06764,
title = {Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning},
author = {Hongsheng Zhang and Zhong Ji and Jingren Liu and Yanwei Pang and Jungong Han},
journal= {arXiv preprint arXiv:2411.06764},
year = {2024}
}