GLU 注意力机制提升 Transformer
机器学习
2025-07-08 v2 人工智能
计算与语言
神经与进化计算
摘要
门控线性单元 (GLU) 在增强神经网络性能方面显示出巨大的潜力。本文提出一种名为 GLU 注意力的新型注意力机制,引入非线性到注意力的值中。我的实验表明,GLU 注意力在文本和视觉模态上均提升了模型性能和收敛速度,额外参数为零,计算成本几乎可忽略不计。GLU 注意力轻量级,可无缝集成到其他技术中,例如 Flash 注意力、旋转位置编码 (RoPE) 以及各种多头注意力 (MHA) 变体,如分组查询注意力 (GQA)。该项目已开源于 github。
引用
@article{arxiv.2507.00022,
title = {GLU Attention Improve Transformer},
author = {Zehao Wang},
journal= {arXiv preprint arXiv:2507.00022},
year = {2025}
}
备注
4 pages 5 figures