通过正交学习与自正则化提高视觉语言模型的鲁棒性
计算机视觉与模式识别
2024-10-17 v3
摘要
高效微调视觉语言模型(VLM)如 CLIP 以适应特定下游任务正日益受到关注。以往工作主要聚焦于 prompt learning 以将 CLIP 适配至各种下游任务,但在小数据集上微调时会出现任务过拟合问题。本文我们引入一种正交微调方法,用于高效微调预训练权重,同时实现增强的鲁棒性和泛化能力,我们进一步利用自正则化策略维持 VLMs 在零样本泛化方面的稳定性,称之为 OrthSR。具体而言,我们无缝注入可训练的正交矩阵于 transformer 架构中,并在训练期间施加正交约束,凭借其范数保持特性实现稳定且更快的收敛,同时保持预训练权重冻结。为缓解微调导致的偏离,进一步采用自正则化策略以便捷方式保留模型在训练期间的泛化能力。此外,为丰富小数据集情境下下游任务的样本多样性,我们首先探索注意力 CutOut 数据增强以提升高效微调效果,从而增强模型对特定下游任务的拟合能力。我们还对如何改善特定下游性能并维持泛化性提供了理论分析。首次我们重访 CLIP 和 CoOp 以本方法有效提升模型在少样本图像分类情境下的表现,与精心设计的 prompt learning 方法相当。
引用
@article{arxiv.2407.08374,
title = {Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization},
author = {Jinlong Li and Dong Zhao and Zequn Jie and Elisa Ricci and Lin Ma and Nicu Sebe},
journal= {arXiv preprint arXiv:2407.08374},
year = {2024}
}