CPL:面向视觉与语言模型的反事实提示学习
计算机视觉与模式识别
2022-11-16 v3 人工智能
计算与语言
摘要
提示微调是一种新的少样本迁移学习技术,仅对CLIP等预训练视觉与语言模型的可学习提示进行调优。然而,现有提示微调方法倾向于学习虚假或纠缠的表示,导致对未见概念的泛化能力差。为实现从有限样本中进行的非虚假且高效的提示学习,本文提出一种新颖的\underline{\textbf{C}}ounterfactual \underline{\textbf{P}}rompt \underline{\textbf{L}}earning(CPL,反事实提示学习)方法用于视觉与语言模型,其在联合优化框架中同时采用反事实生成与对比学习。特别地,CPL通过识别语义相似的正样本与负样本之间导致概念变化的最小非虚假特征改变来构建反事实,并通过对比学习从事实与反事实样本中学习更具泛化性的提示表示。大量实验表明,CPL在不同视觉与语言任务上比以往CLIP上的提示微调方法获得更优的少样本性能。在图像分类上,我们在七个数据集上对未见类别实现了3.55%的平均相对提升;在图像-文本检索和视觉问答上,我们在未见测试集的三个少样本场景中分别获得了高达4.09%和25.08%的相对提升。
引用
@article{arxiv.2210.10362,
title = {CPL: Counterfactual Prompt Learning for Vision and Language Models},
author = {Xuehai He and Diji Yang and Weixi Feng and Tsu-Jui Fu and Arjun Akula and Varun Jampani and Pradyumna Narayana and Sugato Basu and William Yang Wang and Xin Eric Wang},
journal= {arXiv preprint arXiv:2210.10362},
year = {2022}
}