Activator: 将 GLU 激活函数作为视觉 Transformer 的核心组件
计算机视觉与模式识别
2025-11-27 v4
摘要
Transformer 架构在深度学习领域的众多任务中取得了许多成功,尤其是近期在自然语言处理 (NLP) 领域的突破,最终导向大型语言模型 (LLM)。将此成功引入计算机视觉 (CV) 领域,推动了视觉相关任务的诸多进展,为多任务和多模态深度学习架构的设计开辟了道路。这些架构的一个缺点是依赖基于 softmax 激活函数的缩放点积注意力机制,这在训练和推理过程中需要大量计算资源。本文考察将 transformer 架构中通常采用的 MLP 和注意力机制替换为基于门控线性单元 (GLU) 激活函数结构的架构,以实现计算成本的降低。通过等效的实验评估,我们发现,该修改在针对所选基线架构进行针对性计算复杂度降低的目标下,仍能实现具竞争力的性能。结果在很大程度上支持了本文的目标,即广泛利用基于 GLU 的 MLP,确立一种在降低计算复杂度的同时仍具能力的替代方案,作为 transformer 架构设计中传统 MLP 和注意力机制的核心组件。
引用
@article{arxiv.2405.15953,
title = {Activator: GLU Activation Function as the Core Component of a Vision Transformer},
author = {Abdullah Nazhat Abdullah and Tarkan Aydin},
journal= {arXiv preprint arXiv:2405.15953},
year = {2025}
}