中文

IterL2Norm:快速迭代 L2 归一化

机器学习 2025-01-20 v2

摘要

基于 Transformer 的大型语言模型是一种内存受限模型,其操作基于大量边际复用的数据。因此,主机与加速器之间的数据移动很可能决定总的墙钟时间。层归一化是 Transformer 模型中的关键工作负载之一,位于每个多头注意力和前馈网络块之后。为减少数据移动,需要在与矩阵-矩阵乘法引擎相同的芯片上执行层归一化。为此,我们提出了一种针对一维输入的迭代 L2 归一化方法(IterL2Norm),确保在五步迭代内快速收敛到稳态解,并具有高精度,在 OPT 模型使用的嵌入长度下,FP32 的九种情况中有六种、BFloat16 的九种情况中有五种优于快速逆平方根算法。在 32/28nm CMOS 中实现后,IterL2Norm 宏在 100MHz/1.05V 下对 d 维向量进行归一化,其中 64 ≤ d ≤ 1024,延迟为 116–227 个周期。

关键词

引用

@article{arxiv.2412.04778,
  title  = {IterL2Norm: Fast Iterative L2-Normalization},
  author = {ChangMin Ye and Yonguk Sim and Youngchae Kim and SeongMin Jin and Doo Seok Jeong},
  journal= {arXiv preprint arXiv:2412.04778},
  year   = {2025}
}

备注

Design, Automation & Test in Europe Conference 2025