中文

GLU 注意力机制提升 Transformer

机器学习 2025-07-08 v2 人工智能 计算与语言 神经与进化计算

摘要

门控线性单元 (GLU) 在增强神经网络性能方面显示出巨大的潜力。本文提出一种名为 GLU 注意力的新型注意力机制,引入非线性到注意力的值中。我的实验表明,GLU 注意力在文本和视觉模态上均提升了模型性能和收敛速度,额外参数为零,计算成本几乎可忽略不计。GLU 注意力轻量级,可无缝集成到其他技术中,例如 Flash 注意力、旋转位置编码 (RoPE) 以及各种多头注意力 (MHA) 变体,如分组查询注意力 (GQA)。该项目已开源于 github。

关键词

引用

@article{arxiv.2507.00022,
  title  = {GLU Attention Improve Transformer},
  author = {Zehao Wang},
  journal= {arXiv preprint arXiv:2507.00022},
  year   = {2025}
}

备注

4 pages 5 figures