中文

基于提示调优的适配器用于视觉-语言模型适配

计算机视觉与模式识别 2023-03-28 v1 人工智能

摘要

大型预训练视觉-语言(VL)模型在适配各类下游任务中展现出显著潜力。然而,由于模型参数量巨大,微调整个网络颇具挑战。为解决该问题,诸如提示调优等高效适配方法已被提出。我们探索了以多任务预训练初始化进行提示调优的思路,并发现其能显著提升模型性能。基于我们的发现,我们引入一个名为 Prompt-Adapter 的新模型,其将预训练提示调优与高效适配网络相结合。我们的方法在公开 11 个数据集上的少样本图像分类中击败了最先进方法,尤其在 1 shot、2 shots、4 shots 和 8 shots 图像等数据实例有限的设定下。我们所提方法展示了结合提示调优与参数高效网络以实现高效视觉-语言模型适配的前景。代码公开于:https://github.com/Jingchensun/prompt_adapter。

关键词

引用

@article{arxiv.2303.15234,
  title  = {Prompt Tuning based Adapter for Vision-Language Model Adaption},
  author = {Jingchen Sun and Jiayu Qin and Zihao Lin and Changyou Chen},
  journal= {arXiv preprint arXiv:2303.15234},
  year   = {2023}
}