中文

闪速可解释性:利用 LM-Head 解码大语言模型中的专业化特征神经元

计算与语言 2025-03-03 v2

摘要

大语言模型(LLM)通常具有数十亿参数,因此其运行机制往往难以解释。在本工作中,我们证明了可以通过模型的最终投影层(LM-head)将神经元权重直接解码为词元概率。我们在 Llama 3.1 8B 中对此进行了说明,使用 LM-head 找到了专业化特征神经元的例子,如“狗”神经元和“加州”神经元,并通过钳制这些神经元以影响输出中该概念的概率来进行了验证。我们在预训练模型和 Instruct 模型上均评估了该方法,发现 Instruct 模型上投影层中超过 75% 的神经元与预训练模型具有相同的最高关联词元。最后,我们证明,钳制“狗”神经元会使 Instruct 模型在被问及其最喜欢的动物时总是谈论狗。通过我们的方法,只需极少的计算量,即可在 10 秒内映射出 Llama 3.1 8B 全部上投影神经元的顶级特征。

关键词

引用

@article{arxiv.2501.02688,
  title  = {Flash Interpretability: Decoding Specialised Feature Neurons in Large Language Models with the LM-Head},
  author = {Harry J Davies},
  journal= {arXiv preprint arXiv:2501.02688},
  year   = {2025}
}

备注

5 pages, 4 figures