中文

面向难度无关的视觉语言模型高效迁移学习

计算机视觉与模式识别 2024-10-14 v2 人工智能

摘要

像CLIP这样的视觉语言模型(VLMs)已在包括零样本图像分类在内的多种下游任务中展现出显著适用性。近来,使用提示或适配器进行高效迁移学习(ETL)因能有效适应下游任务而受到极大关注。然而,以往研究忽视了下游任务迁移难度各异的挑战。本文中,我们实证分析了各ETL方法相对于迁移难度的表现。我们的观察表明,在高难度领域中,利用视觉提示和文本适配器对适应性和泛化性至关重要。此外,通过应用一种自适应集成方法,将任务适配的VLM与预训练VLM相整合,并在低难度领域策略性地利用更多通用知识、在高难度领域利用更少,我们在两类领域上均持续提升性能。基于这些观察,我们提出一种自适应集成方法,将视觉提示和文本适配器与预训练VLM结合,并按迁移难度定制,以在任何目标领域实现最优性能。在大量基准上实验,我们的方法持续优于所有基线,尤其在未见过任务上,证明了其有效性。

关键词

引用

@article{arxiv.2311.15569,
  title  = {Towards Difficulty-Agnostic Efficient Transfer Learning for Vision-Language Models},
  author = {Yongjin Yang and Jongwoo Ko and Se-Young Yun},
  journal= {arXiv preprint arXiv:2311.15569},
  year   = {2024}
}

备注

EMNLP 2024; code available at: https://github.com/YangYongJin/APEX