基于双对齐的视觉语言模型上下文感知提示微调
计算机视觉与模式识别
2023-09-11 v1
摘要
大规模视觉语言模型(VLMs),如CLIP,从海量训练数据中学习广泛的视觉概念,展现出卓越的泛化能力。已有大量提示学习方法被提出,以仅用少量训练样本高效地将VLMs适配到下游任务。我们引入一种新方法,通过结合预训练大语言模型(LLMs)来改进视觉语言模型的提示学习,称为双对齐提示微调(DuAl-PT)。像CoOp那样的可学习提示通过端到端训练隐式建模上下文,难以控制和解释。而由LLMs(如GPT-3)生成的显式上下文描述可直接用于零样本分类,此类提示过度依赖LLMs且在少样本领域仍待探索。通过DuAl-PT,我们提出学习更具上下文感知的提示,同时受益于显式与隐式上下文建模。为此,我们引入预训练LLM生成上下文描述,并鼓励提示通过对齐从LLM的知识中学习,以及提示与局部图像特征之间的对齐。实证上,DuAl-PT在11个下游数据集的少样本识别和基到新泛化任务上取得了优越性能。希望DuAl-PT可作为强基线。代码将公开。
引用
@article{arxiv.2309.04158,
title = {Context-Aware Prompt Tuning for Vision-Language Model with Dual-Alignment},
author = {Hongyu Hu and Tiancheng Lin and Jie Wang and Zhenbang Sun and Yi Xu},
journal= {arXiv preprint arXiv:2309.04158},
year = {2023}
}