中文

重新审视提示在视觉微调中的能力

计算机视觉与模式识别 2024-05-28 v3 机器学习

摘要

视觉提示微调(VPT)是一种极具前景的解决方案,它通过引入可学习的提示词标记来定制预训练模型以适应下游任务。然而,VPT 及其变体常面临提示初始化、提示长度以及在自监督预训练中性能不佳等挑战,阻碍了成功的上下文适应。本研究首先探讨了在有效训练期间提示词标记与图像块标记之间相关性的演变。受观察到提示词标记倾向于与图像块标记共享高互信息的启发,我们提出使用下游标记原型来初始化提示。这种策略性初始化作为先前初始化的替代,显著提升了微调性能。为了进一步优化,我们通过一个简化的流程优化标记构建,与 VPT 相比,在几乎不增加计算开销的情况下保持了优异的性能。详尽的实验表明,我们提出的方法以显著优势超越了现有方法。例如,在 FGVC 和 VTAB-1K 基准上,使用不到 0.4% 的可学习参数,它在 24 个任务中的 19 个任务上超越了全量微调。值得注意的是,我们的方法显著推进了自监督预训练的适应,实现了至少 10% 到 30% 的令人瞩目的任务性能提升。此外,实验结果表明,所提出的 SPT 对提示长度具有鲁棒性,并且能随模型容量和训练数据规模良好扩展。我们最终对促进预训练模型适应下游任务的目标数据量提供了深入探讨。代码可在 https://github.com/WangYZ1608/Self-Prompt-Tuning 获取。

关键词

引用

@article{arxiv.2402.02382,
  title  = {Revisiting the Power of Prompt for Visual Tuning},
  author = {Yuzhu Wang and Lechao Cheng and Chaowei Fang and Dingwen Zhang and Manni Duan and Meng Wang},
  journal= {arXiv preprint arXiv:2402.02382},
  year   = {2024}
}

备注

Accepted by ICML2024, See https://github.com/WangYZ1608/Self-Prompt-Tuning