中文

从注意力到激活:揭示大型语言模型的谜团

计算与语言 2024-10-23 v1

摘要

我们研究了自回归Transformer中的两个奇怪现象:(1) 注意力头中第一个token的主导地位;(2) 隐藏状态中出现大的异常激活。我们发现,流行的LLM,如Llama,在98%的注意力头中最大程度地关注第一个token,我们将此行为归因于softmax函数。为了缓解这个问题,我们提出了将softmax重新表述为softmax-1。此外,我们确定自适应优化器(例如Adam)是导致大异常激活的主要原因,并引入了OrthoAdam,一种利用正交矩阵变换梯度的新型优化器,以解决这个问题。最后,我们的方法不仅防止了这些现象的发生,而且还使Transformer在使用基本算法进行量化时能够保持其性能,这是标准方法无法做到的。总之,我们的方法将第一个token上的注意力比例从65%降低到3.3%,隐藏状态中的激活峰度从1657降低到3.1,在4位权重量化下的困惑度惩罚从3565降低到0.3。

关键词

引用

@article{arxiv.2410.17174,
  title  = {From Attention to Activation: Unravelling the Enigmas of Large Language Models},
  author = {Prannay Kaul and Chengcheng Ma and Ismail Elezi and Jiankang Deng},
  journal= {arXiv preprint arXiv:2410.17174},
  year   = {2024}
}

备注

10 pages