中文

大语言模型中的神经元:死亡、N-gram、位置性

计算与语言 2023-09-12 v1

摘要

我们以可在单块 GPU 上完成的轻量级方式分析了一系列大语言模型(LLM)。具体而言,我们聚焦于参数量从 125m 到 66b 的 OPT 系列模型,且仅依赖前馈网络(FFN)神经元是否被激活。首先,我们发现网络的前层是稀疏的并表征许多离散特征。此处许多神经元(66b 模型某些层中超过 70%)是“死亡”的,即它们在大量多样化数据上从未激活。同时,许多存活神经元被保留给离散特征并充当词元与 n-gram 检测器。有趣的是,它们对应的 FFN 更新不仅如预期般促进下一词元候选,还显式地聚焦于移除关于触发它们的词元(即当前输入)的信息。据我们所知,这是专门从残差流中移除(而非添加)信息的机制的首个例证。随着规模增大,模型在某种意义下变得更稀疏:它们拥有更多死亡神经元和词元检测器。最后,一些神经元是位置性的:它们是否被激活很大程度上(或完全)取决于位置,而较少(或根本不)取决于文本数据。我们发现较小模型具有充当位置区间指示器的神经元集合,而较大模型以较不显式的方式运作。

关键词

引用

@article{arxiv.2309.04827,
  title  = {Neurons in Large Language Models: Dead, N-gram, Positional},
  author = {Elena Voita and Javier Ferrando and Christoforos Nalmpantis},
  journal= {arXiv preprint arXiv:2309.04827},
  year   = {2023}
}