中文

APLA:一种简单的 Vision Transformer 适配方法

计算机视觉与模式识别 2025-03-25 v2

摘要

现有的适配技术通常需要修改架构或增加参数,导致高计算成本和复杂性。我们引入了注意力投影层适配 (APLA),这是一种在不改变架构或增加参数的情况下适配 Vision Transformer (ViT) 的简单方法。通过系统分析,我们发现紧随注意力机制之后的层对适配至关重要。通过仅更新该投影层,甚至仅更新该层权重的随机子集,APLA 实现了 SOTA 性能,同时将 GPU 内存使用量最多减少 52.63%,训练时间最多减少 43.0%,且在推理时无额外成本。在涵盖场景分类、医学成像、卫星成像和细粒度分类等多种任务的 46 个数据集上,APLA 在分类、分割和检测任务上始终优于包括完全微调在内的其他 17 种领先的适配方法。代码可在 https://github.com/MoeinSorkhei/APLA 获取。

关键词

引用

@article{arxiv.2503.11335,
  title  = {APLA: A Simple Adaptation Method for Vision Transformers},
  author = {Moein Sorkhei and Emir Konuk and Kevin Smith and Christos Matsoukas},
  journal= {arXiv preprint arXiv:2503.11335},
  year   = {2025}
}