中文

级联提示学习用于视觉-语言模型适配

计算机视觉与模式识别 2024-09-27 v1

摘要

提示学习已成为增强视觉-语言模型(VLM)如 CLIP 在下游任务上性能的有效方法。然而,当前可学习的提示标记主要用于单一的任务适配阶段(即适配提示),容易导致过拟合风险。在这项工作中,我们提出了一种新颖的级联提示学习(CasPL)框架,使提示学习能够同时服务于通用和特定专业知识(即增强和适配提示)。具体来说,CasPL 是一种新的学习范式,包含两个不同阶段的可学习提示:第一个增强提示旨在通过使用大量无标注领域图像对齐其预测的 logits,从更高级的更大 CLIP 教师模型中提取领域通用知识。然后,第二个适配提示与冻结的第一组提示级联,以微调下游任务,遵循先前研究中采用的方法。通过这种方式,CasPL 可以有效地将领域通用和任务特定的表示捕获到明确不同的渐进提示组中,从而潜在地缓解目标领域的过拟合问题。值得注意的是,CasPL 作为一个即插即用模块,可以无缝集成到任何现有的提示学习方法中。CasPL 在性能和推理速度之间实现了显著更好的平衡,这对于在资源受限环境中部署较小的 VLM 模型尤其有益。与先前最先进的方法 PromptSRC 相比,CasPL 在 11 个图像分类数据集上,基类平均提升 1.85%,新类平均提升 3.44%,调和平均数平均提升 2.72%。代码已公开:https://github.com/megvii-research/CasPL。

关键词

引用

@article{arxiv.2409.17805,
  title  = {Cascade Prompt Learning for Vision-Language Model Adaptation},
  author = {Ge Wu and Xin Zhang and Zheng Li and Zhaowei Chen and Jiajun Liang and Jian Yang and Xiang Li},
  journal= {arXiv preprint arXiv:2409.17805},
  year   = {2024}
}

备注

ECCV2024