DPC:基于双提示协同进行视觉语言模型微调
计算机视觉与模式识别
2025-03-25 v1 多媒体
摘要
基于CLIP的提示微调过程中普遍存在Base-New权衡(BNT)问题,即在对基础(目标)类别进行连续微调时,会同时降低对新(未见)类别的泛化能力。现有方法试图通过添加约束来调节提示微调过程以平衡BNT,但这些约束施加在相同的目标提示上,无法充分避免基础与新类别优化方向之间的相互排斥。为解决这一挑战,我们提出一种插即插的双提示协同(DPC)框架,这是首个在提示层面解耦基础与新任务优化过程的方案。具体而言,我们基于 backbone 提示克隆一个可学习的平行提示,引入可变权重解耦框架,独立控制针对基础或新任务的双提示优化方向,从而避免泛化能力的冲突。同时,我们提出一种动态硬负优化器,利用双提示构建更具挑战性的基础类别优化任务以实现提升。对于可解释性,我们证明了在优化过程中,提示向量的特征通道在不变,这为DPC的Weighting-Decoupling提供了理论支持。 extensive 实验表明,DPC在不引入除基础类别之外的任何外部知识的前提下,显著提升了基础性能,同时保持对新类别的泛化。代码已发布:https://github.com/JREion/DPC。
关键词
引用
@article{arxiv.2503.13443,
title = {DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models},
author = {Haoyang Li and Liang Wang and Chao Wang and Jing Jiang and Yan Peng and Guodong Long},
journal= {arXiv preprint arXiv:2503.13443},
year = {2025}
}
备注
Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2025 (CVPR 2025)