中文

面向视觉语言模型的学习域不变提示

计算机视觉与模式识别 2023-04-03 v2

摘要

提示学习是借助极少样本调优可学习提示向量,将CLIP等强大视觉语言基础模型适配下游数据集的最有效且热门方式之一。然而,尽管提示学习在域内数据上表现优异,仍面临泛化至未见类别与域的主要挑战。一些现有提示学习方法通过为不同词元或域自适应生成不同提示来解决此问题,却忽视了所学提示泛化至未见域的能力。本文提出一种直接生成可泛化至未见域的“域不变”提示的新颖提示学习范式,称为MetaPrompt。具体而言,提出双模态提示调优网络,为图像与文本双模态输入生成提示。借助一种新颖的非对称对比损失,原始预训练视觉语言模型的表征作为监督以增强所学提示的泛化能力。更重要的是,我们提出基于元学习的提示调优算法,显式约束为某一域或类别调优的任务特定提示亦能在另一域或类别取得良好性能。在11个数据集上的基类到新类泛化实验与4个数据集上的域泛化实验表明,我们的方法持续且显著优于现有方法。

关键词

引用

@article{arxiv.2212.04196,
  title  = {Learning Domain Invariant Prompt for Vision-Language Models},
  author = {Cairong Zhao and Yubin Wang and Xinyang Jiang and Yifei Shen and Kaitao Song and Dongsheng Li and Duoqian Miao},
  journal= {arXiv preprint arXiv:2212.04196},
  year   = {2023}
}

备注

12 pages, 6 figures, 5 tables