中文

FlashNorm:面向 Transformer 的高速归一化

广义相对论与量子宇宙学 2024-08-20 v2

摘要

归一化层在大型语言模型(LLM)中屡见不鲜,却成为计算瓶颈:在具有向量与矩阵执行单元的硬件上,RMS 计算阻塞后续矩阵乘法,阻碍并行执行。我们提出 FlashNorm,将 RMSNorm 精确重构为线性层,(i) 通过折叠归一化权重到随后的线性层中消除其权重,(ii) 将标量 RMS 归一化延迟到矩阵乘法输出后执行,从而实现两者的并行。此外,由于 RMS 的尺度不变性,RMSNorm 接续线性层再接一个 RMSNorm 可完全消除前者——在采用 QKV 归一化的模型(如 Gemma~4)以及包含潜在归一化的 MLA 模型(如 DeepSeek-V2、Mistral Small 4、OpenMythos)中可完全消除注意力前的 RMSNorm。相同技术也适用于 LayerNorm、Dynamic Tanh (DyT)、带 GLU 变体的前馈网络以及基于 RoPE 的注意力。在 NVIDIA T4 GPU 上,FlashNorm 在计算受限(预填充) regime 下,针对 SmolLM2-135M 规模的 norm-then-project 操作实现 33-35% 的延迟降低,针对 Llama-7B 规模实现 12-14% 的延迟降低。我们验证了三种模型上的零损失权重折叠。除推理速度外,FlashNorm 通过减少参数张量数量,简化了模型实现。观看我们的解释视频 https://youtu.be/GEuJv34_XgU?si 并参见 https://github.com/OpenMachine-ai/transformer-tricks 获取代码。

关键词

引用

@article{arxiv.2407.09576,
  title  = {Avoidance of Schwinger Mechanism in Electromagnetically Accelerating Universe},
  author = {Paul H. Frampton},
  journal= {arXiv preprint arXiv:2407.09576},
  year   = {2024}
}

备注

9 pages LaTeX. Additional material on time dependence of cosmological constant