通过混合专家适配器提升视觉语言模型的持续学习能力
计算机视觉与模式识别
2024-06-04 v2
摘要
持续学习可以使视觉语言模型不断获取新知识,而无需访问整个历史数据集。然而,缓解大规模模型中的性能退化并非易事,原因在于 (i) 终身学习过程中的参数偏移,以及 (ii) 全模型调优带来的巨大计算负担。在这项工作中,我们提出了一个参数高效的持续学习框架,以减轻视觉语言模型在增量学习中的长期遗忘。我们的方法涉及通过集成混合专家(MoE)适配器来动态扩展预训练的 CLIP 模型,以响应新任务。为了保持视觉语言模型的零样本识别能力,我们进一步引入了一个分布判别自动选择器(DDAS),该选择器自动将分布内和分布外输入分别路由至 MoE 适配器和原始 CLIP。通过在多种设置下进行的大量实验,我们提出的方法始终优于以往最先进的方法,同时将参数训练负担减少了 60%。我们的代码位于 https://github.com/JiazuoYu/MoE-Adapters4CL
引用
@article{arxiv.2403.11549,
title = {Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters},
author = {Jiazuo Yu and Yunzhi Zhuge and Lu Zhang and Ping Hu and Dong Wang and Huchuan Lu and You He},
journal= {arXiv preprint arXiv:2403.11549},
year = {2024}
}
备注
This work is accepted by CVPR2024. More modifications may be performed