视觉-语言预训练模型的双模态提示微调
计算机视觉与模式识别
2023-07-10 v4
摘要
随着 CLIP 等大型预训练视觉-语言模型的出现,可通过提示微调将可迁移表征适配到广泛的下游任务。提示微调试图从预训练模型存储的通用知识中探查对下游任务有益的信息。近期提出的一种名为上下文优化(CoOp)的方法从语言侧引入一组可学习向量作为文本提示。然而,仅微调文本提示只能调整合成的“分类器”,而图像编码器所计算出的视觉特征无法被影响,从而导致次优解。本文中,我们提出一种通过同时学习文本与视觉提示的新颖双模态提示微调(DPT)范式。为使最终图像特征更聚焦于目标视觉概念,我们的 DPT 中进一步提出了类感知视觉提示微调(CAVPT)方案,其中类感知视觉提示通过在文本提示特征与图像块 token 嵌入之间执行交叉注意力动态生成,以编码下游任务相关信息与视觉实例信息。在 11 个数据集上的大量实验结果证明了所提方法的有效性与泛化能力。我们的代码见 https://github.com/fanrena/DPT。
引用
@article{arxiv.2208.08340,
title = {Dual Modality Prompt Tuning for Vision-Language Pre-Trained Model},
author = {Yinghui Xing and Qirui Wu and De Cheng and Shizhou Zhang and Guoqiang Liang and Peng Wang and Yanning Zhang},
journal= {arXiv preprint arXiv:2208.08340},
year = {2023}
}
备注
13 pages, 7 figures