中文

MABViT:改进的注意力块增强 Vision Transformer

计算机视觉与模式识别 2024-01-02 v2 机器学习

摘要

近期的研究表明,门控线性单元(Gated Linear Units, GLU)在增强 Transformer 模型方面是有效的,特别是在大语言模型(LLM)中。此外,在每个 Transformer 块内利用并行配置而非传统的串行方法,已被证明能在不显著影响性能的情况下加速 LLM 的训练。然而,当 MLP 和注意力块在图像分类任务中并行运行时,我们观察到性能显著下降。我们提出了一种新颖的 Transformer 变体,在注意力块内集成非线性以解决此问题。我们在 Value 张量上实现了基于 GLU 的激活函数,这项新技术在 ImageNet-1K 数据集上以更少的参数量超越了当前最先进的 Vision Transformer S/16 变体 0.6%。它还在仅使用一半参数的情况下超越了 B/16 变体。此外,我们提供了 GELU 激活函数变体的结果以证实我们的论断。最后,我们展示了与标准架构相比,MABViT 变体在用于深层 Transformer 时展现出更大的潜力。

关键词

引用

@article{arxiv.2312.01324,
  title  = {MABViT -- Modified Attention Block Enhances Vision Transformers},
  author = {Mahesh Ramesh and Aswinkumar Ramkumar},
  journal= {arXiv preprint arXiv:2312.01324},
  year   = {2024}
}

备注

Accepted at Deployable AI Workshop, AAAI Conference