中文

通过比较神经元分析解释大型语言模型中的算术机制

计算与语言 2024-09-24 v1

摘要

我们发现算术能力存在于有限数量的注意力头中,每个头专注于不同的运算。为了深入探究其原因,我们引入了比较神经元分析(CNA)方法,该方法识别出了一条由从输入到预测的四个不同阶段组成的内部逻辑链:浅层 FFN 神经元进行特征增强,浅层注意力层进行特征转移,算术头进行特征预测,以及深层 FFN 神经元之间进行预测增强。此外,我们在特征增强和特征预测阶段均识别出了人类可解释的 FFN 神经元。这些发现促使我们研究了 LoRA 的机制,揭示其通过放大与预测相关的 FFN 神经元的系数分数来增强预测概率。最后,我们将该方法应用于算术任务的模型剪枝以及减少性别偏见的模型编辑。代码位于 https://github.com/zepingyu0512/arithmetic-mechanism。

关键词

引用

@article{arxiv.2409.14144,
  title  = {Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis},
  author = {Zeping Yu and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2409.14144},
  year   = {2024}
}

备注

Accepted by EMNLP 2024 main. Mechanistic interpretability for arithmetic tasks in large language models