中文

我们真的需要大量视觉提示吗?

计算机视觉与模式识别 2024-05-14 v2 人工智能

摘要

由于对资源受限边缘设备上适配模型的兴趣日益增长,参数高效迁移学习已被广泛探索。在各种方法中,视觉提示微调(VPT)将可学习提示前置到输入空间,与全网络参数训练相比展现出有竞争力的微调性能。然而,VPT增加了输入令牌数量,导致额外的计算开销。本文中,我们分析了提示数量对视觉Transformer架构中微调性能和自注意力操作的影响。通过理论和实证分析,我们表明添加更多提示并不会带来线性性能提升。此外,我们提出一种提示压缩(PC)技术,旨在防止使用少量提示时的性能下降。我们在FGVC和VTAB-1k任务上验证了我们的方法,结果表明我们的方法在保持准确率的同时将提示数量减少了约70%。

关键词

引用

@article{arxiv.2305.17223,
  title  = {Do We Really Need a Large Number of Visual Prompts?},
  author = {Youngeun Kim and Yuhang Li and Abhishek Moitra and Ruokai Yin and Priyadarshini Panda},
  journal= {arXiv preprint arXiv:2305.17223},
  year   = {2024}
}