深入探讨条件提示调优在视觉语言模型中的工作原理
计算机视觉与模式识别
2025-07-01 v1
摘要
尽管条件提示调优(PT)在适应大型视觉语言预训练模型(VLPMs)以应对下游任务方面展现出巨大潜力,但它们往往难以解决基础-新任务权衡(BNT)困境:随着VLPMs对基础任务的调优程度提高,其对新任务的泛化能力却随之下降。最近的条件PT工作通过用动态的视觉图像信息(VII)条件化的提示取代静态提示,旨在解决此问题,一定程度上提升了模型对新任务的泛化能力。本文首先识别了现有条件PT方法的一个关键问题:将VII作为提示的“条件”会导致次优性能,甚至有时随机噪声条件化的提示会优于VII条件化的提示。进一步分析发现,基于文本类别信息(TCI)学习动态提示是解决BNT问题的关键。基于此,我们提出了类别自适应提示调优(CaPT)方法,通过从基础类别学习TCI条件化的提示,实现对调优模型在新类别上的快速适应。值得注意的是,CaPT可作为插件用于缓解现有无条件PT方案的BNT问题。广泛的实验表明,CaPT在11个数据集上 consistently 改善了五种强大的无条件PT基线,几乎没有额外的计算开销。此外,通过将CaPT集成到我们最近提出的DePT框架中,我们构思了一种新的条件PT方法,称为DeCaPT,在11个数据集上的平均H ACC提高了3.49%。代码:https://github.com/Koorye/CaPT。
引用
@article{arxiv.2506.23856,
title = {A Closer Look at Conditional Prompt Tuning for Vision-Language Models},
author = {Ji Zhang and Shihan Wu and Lianli Gao and Jingkuan Song and Nicu Sebe and Heng Tao Shen},
journal= {arXiv preprint arXiv:2506.23856},
year = {2025}
}
备注
18 pages