ReGLA:精炼门控线性注意力
计算与语言
2025-08-12 v3
摘要
大型语言模型(LLM)的最新进展在复杂语言建模任务中表现卓越,但由于softmax注意力的二次计算复杂度,其计算和存储需求也相当显著。为缓解此问题,线性注意力被设计用于降低标准变压器中固有的二次时空复杂度。在本工作中,我们对三个关键组件进行了全面探索,这些组件对Gated Linear Attention模块的性能影响显著:特征映射、归一化和门控机制。我们开发了一种特征映射函数,以解决以往建议所忽视的若干关键问题。随后,我们进一步阐述了归一化层集成的理由,以稳定训练过程。此外,我们探讨了门控机制的饱和现象,并通过引入精炼模块进行了补充。我们进行了大量实验,表明该架构在包括从头训练和后线性化连续预训练等大量任务上的表现优于以往的Gated Linear Attention机制。
引用
@article{arxiv.2502.01578,
title = {ReGLA: Refining Gated Linear Attention},
author = {Peng Lu and Ivan Kobyzev and Mehdi Rezagholizadeh and Boxing Chen and Philippe Langlais},
journal= {arXiv preprint arXiv:2502.01578},
year = {2025}
}
备注
Accepted by NAACL 2025 (main)