基于简单参数高效修改的视觉-语言模型微调
计算机视觉与模式识别
2024-11-20 v2 人工智能
计算与语言
机器学习
机器人学
摘要
视觉-语言模型 (VLM) 微调的最新进展见证了提示微调与适配器微调的成功,而针对固有参数的经典模型微调似乎被忽视。人们认为,使用少样本微调 VLM 的参数会破坏预训练知识,因为微调 CLIP 模型甚至会导致性能下降。本文重新审视这一观点,并提出一个新视角:微调特定参数而非全部参数,将释放经典模型微调在 VLM 上的潜力。通过细致研究,我们提出 ClipFit,一种简单而有效的方法,无需引入任何额外参数开销即可微调 CLIP。我们证明,仅微调特定的偏置项与归一化层,ClipFit 即可将零样本 CLIP 的平均调和均值准确率提升 7.27%。最后,为理解 CLIPFit 中的微调如何影响预训练模型,我们针对内部参数与表示的变化进行了广泛的实验分析。我们发现,低层文本偏置层与第一层归一化层的变化远大于其他层。代码可在 \url{https://github.com/minglllli/CLIPFit} 获取。
引用
@article{arxiv.2409.16718,
title = {Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification},
author = {Ming Li and Jike Zhong and Chenxin Li and Liuzhuozheng Li and Nie Lin and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2409.16718},
year = {2024}
}
备注
EMNLP 2024 Main Conference