中文

VPA:全测试时视觉提示自适应

计算机视觉与模式识别 2023-09-28 v1 人工智能

摘要

文本提示微调通过将手工设计的提示视为可训练参数,在使自然语言处理模型适应多种下游任务方面已展现出显著的性能提升。受文本提示成功的启发,若干研究探讨了视觉提示微调的有效性。本文提出视觉提示自适应(Visual Prompt Adaptation, VPA),这是首个将视觉提示与测试时自适应相结合的框架。VPA引入少量可学习令牌,实现了全测试时且存储高效的适应,无需源域信息。我们在多种自适应设置下检验了VPA设计,包括单图像、批图像和伪标签自适应。我们在多项任务上评估VPA,包括分布外(OOD)泛化、 corruption鲁棒性和域适应。实验结果表明,VPA在各种模型上通过3.3%的提升有效增强了OOD泛化,超越了先前的测试时方法。此外,我们显示VPA相较强基线将corruption鲁棒性提高了6.5%。最后,我们证明VPA相对提升了5.2%的域适应性能。我们的VPA在提升视觉-语言模型的零样本识别鲁棒性方面也表现出显著效果。

关键词

引用

@article{arxiv.2309.15251,
  title  = {VPA: Fully Test-Time Visual Prompt Adaptation},
  author = {Jiachen Sun and Mark Ibrahim and Melissa Hall and Ivan Evtimov and Z. Morley Mao and Cristian Canton Ferrer and Caner Hazirbas},
  journal= {arXiv preprint arXiv:2309.15251},
  year   = {2023}
}