理解与改进视觉提示:一种标签映射视角
计算机视觉与模式识别
2023-03-28 v5
摘要
我们重新审视并推进视觉提示(VP),一种用于视觉任务的输入提示技术。VP 可通过将通用提示(以输入扰动模式的形式)简单地融入下游数据点,将固定的预训练源模型重新编程以完成目标域中的下游任务。然而,即便在源类别与目标类别之间存在无规则标签映射(LM)的情况下 VP 仍保持有效,其原因仍不清楚。受此启发,我们提出:LM 与 VP 如何相互关联?以及如何利用这种关系来提升其在目标任务上的准确率?我们深入探究 LM 对 VP 的影响,并给出肯定答案:LM 更好的“质量”(由映射精度与可解释性评估)能够持续提高 VP 的有效性。这与先前缺失 LM 因素的研究形成对比。为优化 LM,我们提出一种新的 VP 框架,称为 ILM-VP(基于迭代标签映射的视觉提示),其自动将源标签重映射到目标标签,并逐步提升 VP 的目标任务准确率。此外,当使用对比语言-图像预训练(CLIP)模型时,我们提出集成一个 LM 过程以辅助 CLIP 的文本提示选择并提升目标任务准确率。大量实验表明,我们的方案显著优于最先进的 VP 方法。如下所示,我们展示当将 ImageNet 预训练的 ResNet-18 重新编程至 13 个目标任务时,我们的方法以显著优势超越基线,例如在迁移学习至目标 Flowers102 与 CIFAR100 数据集上分别带来 7.9% 与 6.7% 的准确率提升。此外,我们基于 CLIP 的 VP 方案在 Flowers102 与 DTD 上分别提供 13.7% 与 7.1% 的准确率提升。我们的代码见 https://github.com/OPTML-Group/ILM-VP。
引用
@article{arxiv.2211.11635,
title = {Understanding and Improving Visual Prompting: A Label-Mapping Perspective},
author = {Aochuan Chen and Yuguang Yao and Pin-Yu Chen and Yihua Zhang and Sijia Liu},
journal= {arXiv preprint arXiv:2211.11635},
year = {2023}
}
备注
CVPR 2023