中文

高效测试时提示调优:面向视觉语言模型

计算机视觉与模式识别 2024-08-13 v1

摘要

视觉语言模型在配合合适的文本提示后,展现出惊人的零样分类能力。然而,现有方法通常需要在推理过程中对每张图像进行提示适配,计算开销高,限制了可扩展性和实际部署。为此,我们提出 Self-TPT 框架,利用自监督学习实现高效测试时提示调优。Self-TPT 的关键在于通过自监督学习进行高效的预定义类别适配,从而避免推理时的计算密集型逐图像适配。Self-TPT 通过对源数据进行自监督任务和分类任务的联合训练,随后仅使用自监督任务进行测试时新类别适配。具体而言,我们提出对比提示学习(CPT)作为自监督的关键任务。CPT 通过对比学习最小化类内距离并增强类间可区分性。此外,实证表明 CPT 能较好地模拟分类任务的反向传播梯度,这解释了其有效性。基于此,我们进一步引入梯度匹配损失以显式提升梯度相似性。我们在三个具有挑战性的零样本基准上评估了 Self-TPT,结果一致显示,Self-TPT 不仅显著降低推理成本,还实现了最先进的性能,有效平衡了效率与效果之间的权衡。

关键词

引用

@article{arxiv.2408.05775,
  title  = {Efficient Test-Time Prompt Tuning for Vision-Language Models},
  author = {Yuhan Zhu and Guozhen Zhang and Chen Xu and Haocheng Shen and Xiaoxin Chen and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2408.05775},
  year   = {2024}
}