中文

ViT-AdaLA:基于线性注意力的 Vision Transformer 适应框架

计算机视觉与模式识别 2026-03-18 v1

摘要

基于 Vision Transformer(ViT)的视觉基础模型(VFM)在多样化视觉任务上取得了显著的性能,但因注意力复杂度呈二次方增长,限制了其在长序列上的可扩展性。现有的线性注意力方法通常需从头训练,需大量计算资源;而为大型语言模型解码器开发的线性化方法难以直接应用于 ViT。为此,本文提出 ViT-AdaLA,一种新型框架,用于有效地将 VFM 的先验知识适配到线性注意力 ViT 中。ViT-AdaLA 包含三个阶段:注意力对齐、特征对齐和监督微调。在注意力对齐阶段,我们将每个模块中的线性注意力与原始 softmax 注意力对齐,以逼近 softmax 注意力的行为。然而,残差近似误差必然在各层之间累积。我们通过对线性化 ViT 进行微调,将其最终层的特征与冻结的 softmax VFM 教师模型对齐来缓解此问题。最终,我们将适配后的先验知识通过监督微调传递到下游任务。广泛的分类和分割实验表明,ViT-AdaLA 在各种最先进的线性注意力方法上均表现出有效性和通用性。

关键词

引用

@article{arxiv.2603.16063,
  title  = {ViT-AdaLA: Adapting Vision Transformers with Linear Attention},
  author = {Yifan Li and Seunghyun Yoon and Viet Dac Lai and Franck Dernoncourt and Jason Kuen and Yu Kong and Trung Bui},
  journal= {arXiv preprint arXiv:2603.16063},
  year   = {2026}
}