从注意力到激活:揭示大型语言模型的谜团
计算与语言
2024-10-23 v1
摘要
我们研究了自回归Transformer中的两个奇怪现象:(1) 注意力头中第一个token的主导地位;(2) 隐藏状态中出现大的异常激活。我们发现,流行的LLM,如Llama,在98%的注意力头中最大程度地关注第一个token,我们将此行为归因于softmax函数。为了缓解这个问题,我们提出了将softmax重新表述为softmax-1。此外,我们确定自适应优化器(例如Adam)是导致大异常激活的主要原因,并引入了OrthoAdam,一种利用正交矩阵变换梯度的新型优化器,以解决这个问题。最后,我们的方法不仅防止了这些现象的发生,而且还使Transformer在使用基本算法进行量化时能够保持其性能,这是标准方法无法做到的。总之,我们的方法将第一个token上的注意力比例从65%降低到3.3%,隐藏状态中的激活峰度从1657降低到3.1,在4位权重量化下的困惑度惩罚从3565降低到0.3。
引用
@article{arxiv.2410.17174,
title = {From Attention to Activation: Unravelling the Enigmas of Large Language Models},
author = {Prannay Kaul and Chengcheng Ma and Ismail Elezi and Jiankang Deng},
journal= {arXiv preprint arXiv:2410.17174},
year = {2024}
}
备注
10 pages