面向视觉-语言模型的梯度约束锐度感知提示学习
计算机视觉与模式识别
2023-09-21 v2
摘要
本文针对视觉-语言模型(VLM)可泛化提示学习中的一个新颖权衡问题,即在提升未见类性能的同时保持已见类性能。与现有忽视已见类退化的可泛化方法相比,该问题的设定更为严格且更贴合实际应用。为解决此问题,我们从优化视角出发,利用损失景观几何与模型泛化能力之间的关系。通过分析最先进方法与基于朴素锐度感知最小化(SAM)方法的损失景观,我们得出结论:权衡性能与损失值和损失锐度均相关,且二者缺一不可。然而,我们发现现有方法的优化梯度在优化过程中无法同时保持与损失值和损失锐度的高度相关性,这严重影响了其权衡性能。为此,我们提出一种基于 SAM 的提示学习新方法,称为梯度约束锐度感知上下文优化(GCSCoOp),以动态约束优化梯度,从而同时实现上述双重优化目标。大量实验验证了 GCSCoOp 在权衡问题中的有效性。
引用
@article{arxiv.2309.07866,
title = {Gradient constrained sharpness-aware prompt learning for vision-language models},
author = {Liangchen Liu and Nannan Wang and Dawei Zhou and Xinbo Gao and Decheng Liu and Xi Yang and Tongliang Liu},
journal= {arXiv preprint arXiv:2309.07866},
year = {2023}
}
备注
19 pages 11 figures