中文

SEP:基于自增强提示调优的视觉语言模型

计算机视觉与模式识别 2024-11-25 v3

摘要

基于上下文优化(CoOp)的提示调优有效地通过推断额外的可学习提示标记来适应视觉语言模型(VLM)以应对下游任务。然而,这些标记与预训练标记独立,难以捕获输入特定的知识,如类别感知的文本或实例感知的视觉知识。利用预训练标记所具备的判别性和泛化能力,我们提出一种新方法,即自增强提示调优(SEP)。SEP 的核心原则是从相应的自预训练标记中适应可学习的提示标记,从而显式地将判别性先验知识纳入以增强文本级别和视觉级别的嵌入。此外,SEP 的自增强标记不仅提升判别性,还减轻了未来域的迁移,增强了泛化能力。在实际中,SEP 从所有预训练标记中为每个输入数据在每个编码器层选择几个代表性标记。随后,引入标记融合模块(TFM),通过跨注意力机制将这些代表性标记与可学习标记融合,以生成自增强标记。该自增强标记随后与所有预训练标记拼接,作为后续编码器层的输入,以产生相关嵌入。广泛的基准测试和任务验证了 SEP 在提示调优中的有效性。代码:https://github.com/htyao89/SEP

关键词

引用

@article{arxiv.2405.15549,
  title  = {SEP: Self-Enhanced Prompt Tuning for Visual-Language Model},
  author = {Hantao Yao and Rui Zhang and Lu Yu and Yongdong Zhang and Changsheng Xu},
  journal= {arXiv preprint arXiv:2405.15549},
  year   = {2024}
}