中文

SimA:面向视觉 Transformer 的简易无 Softmax 注意力机制

计算机视觉与模式识别 2024-03-26 v2

摘要

近来,视觉 Transformer 已变得非常流行。然而,在许多应用中部署它们计算成本高昂,部分原因在于注意力模块中的 Softmax 层。我们引入了一个简单但有效的无 Softmax 注意力模块 SimA,它使用简单的 1\ell_1-范数而非 Softmax 层来归一化查询和键矩阵。然后,SimA 中的注意力模块就是三个矩阵的简单乘法,因此 SimA 可以在测试时动态改变计算顺序,以实现对令牌数量或通道数量的线性计算。我们通过实验表明,将 SimA 应用于三种 SOTA Transformer 变体——DeiT、XCiT 和 CvT,在无需任何 Softmax 层的情况下,可获得与 SOTA 模型相当的精度。有趣的是,将 SimA 从多头改为单头对精度影响很小,这进一步简化了注意力模块。代码可在此处获取:https://github.com/UCDvision/sima

关键词

引用

@article{arxiv.2206.08898,
  title  = {SimA: Simple Softmax-free Attention for Vision Transformers},
  author = {Soroush Abbasi Koohpayegani and Hamed Pirsiavash},
  journal= {arXiv preprint arXiv:2206.08898},
  year   = {2024}
}

备注

Code is available here: https://github.com/UCDvision/sima