MaPLe:多模态提示学习
计算机视觉与模式识别
2023-04-04 v3
摘要
预训练的视觉-语言(vision-language, V-L)模型如 CLIP 已展现出对下游任务的优异泛化能力。然而,它们对输入文本提示的选择敏感,并需要仔细挑选提示模板以表现良好。受自然语言处理(Natural Language Processing, NLP)文献启发,近期 CLIP 适配方法学习提示作为文本输入以微调 CLIP 用于下游任务。我们注意到,在 CLIP 的单一分支(语言或视觉)中使用提示适配是次优的,因为它不允许在下游任务上动态调整两个表示空间。本工作中,我们提出面向视觉与语言分支的多模态提示学习(Multi-modal Prompt Learning, MaPLe)以改进视觉与语言表示之间的对齐。我们的设计促进视觉-语言提示之间的强耦合以确保相互协同,并避免学习独立的单模态解。此外,我们在不同早期阶段学习分离的提示,以逐步建模阶段级特征关系,从而实现丰富的上下文学习。我们在三个代表性任务上评估我们方法的有效性:泛化到新类别、新目标数据集和未见的域偏移。与最先进方法 Co-CoOp 相比,MaPLe 展现出更优性能,在 11 个多样化图像识别数据集上平均对新类别取得 3.45% 的绝对提升,对整体调和平均取得 2.72% 的绝对提升。我们的代码与预训练模型发布于 https://github.com/muzairkhattak/multimodal-prompt-learning。
引用
@article{arxiv.2210.03117,
title = {MaPLe: Multi-modal Prompt Learning},
author = {Muhammad Uzair Khattak and Hanoona Rasheed and Muhammad Maaz and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2210.03117},
year = {2023}
}
备注
Accepted at CVPR2023