通过原型进行提示:基于原型的预训练视觉-语言模型提示学习
计算与语言
2022-10-21 v1 计算机视觉与模式识别
摘要
提示学习是一种新的学习范式,它利用文本提示将下游任务重新表述为预训练模型上的类似预训练任务。近期工作表明,提示学习在训练数据有限的少样本学习中尤为有用。根据提示的粒度,这些方法可大致分为任务级提示和实例级提示。任务级提示方法为所有输入样本学习一个通用提示,高效但难以捕捉不同类别间的细微差异。实例级提示方法为每个输入学习特定提示,有效但低效。本工作中,我们提出一种新颖的基于原型的提示学习方法来克服上述局限。具体而言,我们关注预训练视觉-语言模型(PVLMs)上的少样本图像识别任务,并提出了一种通过原型进行提示(PTP)的方法,其中我们定义了 个图像原型和 个提示原型。在 PTP 中,图像原型表示潜在空间中某一图像簇的质心,提示原型定义为连续空间中的软提示。查询图像与图像原型之间的相似度决定了该预测对相应提示原型的依赖程度。因此,在 PTP 中,相似图像将利用相似的提示方式。通过在七个真实基准上的大量实验,我们表明 PTP 是一种利用潜在知识并适配各类 PVLMs 的有效方法。此外,通过详细分析,我们讨论了少样本学习背景下提示学习与参数高效微调的优缺点。
引用
@article{arxiv.2210.10841,
title = {Prompting through Prototype: A Prototype-based Prompt Learning on Pretrained Vision-Language Models},
author = {Yue Zhang and Hongliang Fei and Dingcheng Li and Tan Yu and Ping Li},
journal= {arXiv preprint arXiv:2210.10841},
year = {2022}
}