中文

在像素级释放视觉提示的潜能

计算机视觉与模式识别 2023-03-30 v2

摘要

本文提出了一种简单有效的视觉提示(visual prompting)方法,用于将预训练模型适配到下游识别任务。我们的方法包含两个关键设计。首先,我们不直接将提示与图像相加,而是将提示视为一个额外且独立的可学习组件。我们表明,协调提示与图像的策略至关重要,并发现经验上将提示在适当缩小的图像周围进行扭曲效果最佳。其次,我们将构建可迁移对抗样本时常用的两个“老技巧”,即输入多样性和梯度归一化,重新引入到视觉提示中。这些技术改善了优化并使提示具有更好的泛化能力。我们提供了广泛的实验结果以证明该方法的有效性。使用 CLIP 模型,我们的提示方法在 12 个流行分类数据集上创下了 82.8\% 平均准确率的新纪录,大幅超越先前最优方法 +5.6\%。值得注意的是,该提示性能已经超过线性探测(linear probing) +2.1\%,在某些数据集上甚至可以匹敌全量微调。此外,我们的提示方法在不同数据规模下以及面对分布偏移时均展现出具有竞争力的性能。代码已公开于 https://github.com/UCSC-VLAA/EVP。

关键词

引用

@article{arxiv.2212.10556,
  title  = {Unleashing the Power of Visual Prompting At the Pixel Level},
  author = {Junyang Wu and Xianhang Li and Chen Wei and Huiyu Wang and Alan Yuille and Yuyin Zhou and Cihang Xie},
  journal= {arXiv preprint arXiv:2212.10556},
  year   = {2023}
}