中文

AutoVP:一个自动化视觉提示框架与基准

计算机视觉与模式识别 2024-03-12 v2 机器学习

摘要

视觉提示(VP)是一种新兴的参数高效微调方法,用于适配预训练视觉模型以解决各类下游图像分类任务。然而,迄今为止对 VP 设计空间的系统性研究甚少,且缺乏评估其性能的清晰基准。为弥补这一差距,我们提出 AutoVP,一个端到端可扩展的自动化 VP 设计选择的框架,以及 12 个下游图像分类任务,可作为整体 VP 性能基准。我们的设计空间涵盖:1)提示的联合优化;2)预训练模型的选择,包括图像分类器与文本-图像编码器;3)模型输出映射策略,包括非参数与可训练标签映射。我们广泛的实验结果表明,AutoVP 以显著优势超越当前已知最佳 VP 方法,准确率提升高达 6.7%;并与线性探测(LP)基线相比获得最大 27.5% 的性能提升。因此,AutoVP 作出双重贡献:既作为 VP 设计选择上超参数调优的高效工具,又作为可合理预期加速 VP 发展的综合性基准。源代码见 https://github.com/IBM/AutoVP。

关键词

引用

@article{arxiv.2310.08381,
  title  = {AutoVP: An Automated Visual Prompting Framework and Benchmark},
  author = {Hsi-Ai Tsao and Lei Hsiung and Pin-Yu Chen and Sijia Liu and Tsung-Yi Ho},
  journal= {arXiv preprint arXiv:2310.08381},
  year   = {2024}
}

备注

ICLR 2024