中文

Skip Tuning:预训练视觉-语言模型本身就是高效且有效的适配器

计算机视觉与模式识别 2025-03-17 v2

摘要

提示调优(PT)长期以来被认为是一种有效且高效的范式,通过学习一小组上下文向量将大型预训练视觉-语言模型(VLM)迁移到下游任务。然而,在这项工作中,我们揭示了在学习上下文向量期间冻结VLM的参数既不能促进预训练知识的可迁移性,也不能显著提高内存和时间效率。经过进一步研究,我们发现减少全微调(FT)基线的特征-梯度传播流的长度和宽度是实现有效且高效知识迁移的关键。受此启发,我们提出了Skip Tuning,一种用于将VLM适配到下游任务的新范式。与现有的PT或基于适配器的方法不同,Skip Tuning在FT基线之上应用逐层跳跃(LSkip)和逐类跳跃(CSkip),而不引入额外的上下文向量或适配器模块。在广泛基准上的大量实验证明了我们的Skip Tuning在有效性和效率上均优于PT和基于适配器的方法。代码:https://github.com/Koorye/SkipTuning。

关键词

引用

@article{arxiv.2412.11509,
  title  = {Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves},
  author = {Shihan Wu and Ji Zhang and Pengpeng Zeng and Lianli Gao and Jingkuan Song and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2412.11509},
  year   = {2025}
}