MERGETUNE:视觉语言模型的持续微调
计算机视觉与模式识别
2026-02-27 v3
摘要
对视觉语言模型(如CLIP)进行微调常导致预训练知识的灾难性遗忘。先前的工作主要旨在缓解适应期间的遗忘,但这种遗忘在实际过程中往往难以避免。我们提出一种新范式:持续微调(continued fine-tuning, CFT),旨在在零样例模型已适配后恢复预训练知识。我们提出一种简单且模型无关的CFT策略(命名为MERGETUNE),依据线性模式连接(linear mode connectivity, LMC),可后置应用于现有微调模型,无需修改网络结构。给定微调后的模型,我们继续微调其可训练参数(如软提示或线性分类头),以搜索一种持续模型,使其与零样例(如CLIP)和微调后(如CoOp)解之间的损失路径均较低。通过利用损失景观的几何结构,持续模型在隐式地合并两种解,恢复了在微调后模型中丢失的预训练知识。一个挑战在于,原始LMC约束需要来自预训练任务的数据回放。我们通过二阶近似约束对零样例模型进行近似,无需大规模数据回放。实验表明,MERGETUNE在不增加参数数量的基础上,使CoOp的调和平均提高5.6%。在稳健的微调评估中,MERGETUNE得到的LMC合并模型超越ensemble基线,推理成本更低,并实现进一步提升,在与零样例模型ensemble时达到最新成果。我们的代码已公开于https://github.com/Surrey-UP-Lab/MERGETUNE。
引用
@article{arxiv.2601.10497,
title = {MERGETUNE: Continued Fine-Tuning of Vision-Language Models},
author = {Wenqing Wang and Da Li and Xiatian Zhu and Josef Kittler},
journal= {arXiv preprint arXiv:2601.10497},
year = {2026}
}
备注
20 pages, 5 figures