大语言模型中的神经元级知识归因
计算与语言
2024-09-26 v4 机器学习
摘要
识别对最终预测起重要作用的关键神经元对于理解大语言模型的机制至关重要。由于计算资源的限制,当前的归因技术难以在神经元级别上进行操作。在本文中,我们提出了一种用于精确定位重要神经元的静态方法。与其他七种方法相比,我们的方法在三个指标上均展现出更优的性能。此外,由于大多数静态方法通常只能识别直接贡献于最终预测的“价值神经元”,我们提出了一种识别“查询神经元”的方法,这些神经元会激活上述“价值神经元”。最后,我们应用我们的方法分析了注意力层和前馈网络 (FFN) 层中的六类知识。我们的方法和分析有助于理解知识存储机制,并为未来的知识编辑研究奠定了基础。代码可在 https://github.com/zepingyu0512/neuron-attribution 获取。
引用
@article{arxiv.2312.12141,
title = {Neuron-Level Knowledge Attribution in Large Language Models},
author = {Zeping Yu and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2312.12141},
year = {2024}
}
备注
Accepted by EMNLP 2024 main. This paper aims to identify the important neurons in large language models