通过扩展转换空间和抑制过拟合来增强视觉提示
计算机视觉与模式识别
2026-01-30 v2
摘要
视觉提示(VP)已成为一种引人注目的参数组高效微调方法,用于在不修改模型参数的情况下将预训练视觉模型适应下游任务。尽管提供了诸多优势,如极低的计算开销和与黑箱模型的兼容性,但常规VP方法通常实现的准确率低于其他适应方法。我们的分析揭示了两个关键局限性:简单加法转换的表达受限性以及参数计数增加时的过拟合倾向。为此,我们提出了ACAVP(仿射、颜色和加法视觉提示),通过引入互补转换操作来增强VP的表达能力:仿射变换用于创建任务特定的提示区域,同时保留原始图像信息;颜色变换用于强调与任务相关的视觉特征。此外,我们认识到在VP训练中存在严重的过拟合问题,提出将TrivialAugment作为有效的数据增强方法,这不仅有益于我们的方法,也显著改进了现有VP方法的性能,在某些数据集上提升了最高可达12个百分点。这表明合适的数据增强对VP训练普遍有益。跨十二个多样化图像分类数据集的大量实验,使用两种不同的模型架构表明,ACAVP在VP方法中实现了最高的准确率,超过线性探针的平均准确率,并在分布迁移方面表现出优异的鲁棒性,同时在推理期间保持最小的计算开销。我们的代码可在 https://github.com/s-enmt/ACAVP 获取。
引用
@article{arxiv.2510.07823,
title = {Enhancing Visual Prompting through Expanded Transformation Space and Overfitting Mitigation},
author = {Shohei Enomoto},
journal= {arXiv preprint arXiv:2510.07823},
year = {2026}
}
备注
Accepted to NeurIPS2025