面向视觉语言模型的通用提示调优
计算机视觉与模式识别
2025-01-23 v3
摘要
针对视觉语言模型(如 CLIP)进行的提示调优涉及优化用于生成图像-文本对的文本提示,以适应特定下游任务。虽然手工编写或基于模板的提示适用于更广泛的未见类别,但在下游任务(即已见类别)中往往表现不佳。可学习的软提示另一方面在下游任务中常表现良好,但缺乏通用性。此外,现有研究主要集中于文本模态,鲜有研究尝试从视觉模态探索提示的通用性。基于此,我们调查如何进行提示调优以获得竞争的下游性能和通用性。研究表明,将软提示和手工提示视为文本模态的双视图,通过最大化它们的互信息,能够更好地融合任务特定信息和通用语义信息。此外,为生成更具表达力的提示,本研究引入了来自视觉模态的类别级增强,显著提高了对更广泛未见类别的鲁棒性。在多个基准测试上的广泛评估表明,所提方法在任务特定性能和通用能力方面均达到竞争水平。
引用
@article{arxiv.2410.03189,
title = {Generalizable Prompt Tuning for Vision-Language Models},
author = {Qian Zhang},
journal= {arXiv preprint arXiv:2410.03189},
year = {2025}
}
备注
in progress