视觉提示重构:激活提示的力量
计算机视觉与模式识别
2026-04-09 v1 机器学习
摘要
视觉提示(VP)已成为为再训练的视觉模型适应下游任务的流行方法。与常规模型微调技术不同,VP 在输入数据中直接引入通用扰动,以促进任务特定的微调,而非修改模型参数。然而,VP 与常规微调方法之间存在明显的性能差距,这揭示了在理论和实践中理解和推进输入级 VP 以缩小其当前性能差距的未探索领域。为此,我们提出了一种通用概念,称为激活提示(AP),其扩展了输入级 VP 的作用范围,通过在模型中间层的激活图上应用通用扰动来实现。通过使用 AP 重新审视 VP 并将其作为分析工具,我们展示了 VP 在性能和效率方面的内在局限性,揭示了为何输入级提示可能不如 AP 无效,这表明 AP 具有模型依赖的层偏好。我们还通过分析跨层的全局特征,从理论上阐明了这种偏好的 rationale。通过在 29 个数据集和 various model architectures 上进行大量实验,我们提供了 AP 全面的性能分析,将其与 VP 和参数高效微调基线进行比较。我们的结果表明,AP 在准确率、效率(包括时间、参数、内存使用和吞吐量)方面均优于 VP。
引用
@article{arxiv.2604.06440,
title = {Visual prompting reimagined: The power of the Activation Prompts},
author = {Yihua Zhang and Hongkang Li and Yuguang Yao and Aochuan Chen and Shuai Zhang and Pin-Yu Chen and Meng Wang and Sijia Liu},
journal= {arXiv preprint arXiv:2604.06440},
year = {2026}
}
备注
AISTATS 2026