中文

面向可泛化视觉-语言模型的梯度调节元提示学习

计算机视觉与模式识别 2023-08-21 v2

摘要

提示微调(prompt tuning)是近期兴起的一种范式,通过学习的“软提示”来条件化冻结的预训练模型,使强大的视觉-语言预训练模型能以参数和数据高效的方式适应下游任务。尽管有效,其在少样本场景下问题尤为突出:提示微调性能对初始化敏感,且需耗时寻找良好初始化,从而限制了预训练模型的快速适应能力。此外,提示微调可能削弱预训练模型的泛化性,因为可学习的提示令牌易对有限训练样本过拟合。为解决这些问题,我们引入一种新颖的梯度调节元提示学习(GRAM)框架,该框架仅使用无标签的图像-文本预训练数据,以元学习范式联合元学习一个高效的软提示初始化以实现更好适配,以及一个轻量级梯度调节函数以实现强跨域泛化性。我们的 GRAM 并非设计特定的提示微调方法,而是能以模型无关的方式轻松融入各类提示微调方法中;综合实验表明,在 11 个数据集上的若干设定(如少样本学习、跨域泛化、跨数据集泛化等)中,GRAM 为这些方法带来了稳定提升。进一步实验显示,GRAM 使文本与视觉提示微调的正交方法能以互增强方式运作,提供超越单模态提示微调方法的更好泛化性。

关键词

引用

@article{arxiv.2303.06571,
  title  = {Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language Models},
  author = {Juncheng Li and Minghe Gao and Longhui Wei and Siliang Tang and Wenqiao Zhang and Mengze Li and Wei Ji and Qi Tian and Tat-Seng Chua and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2303.06571},
  year   = {2023}
}

备注

Accepted by ICCV 2023