从神经元到图:大规模解释语言模型神经元
机器学习
2023-06-01 v1 计算与语言
摘要
大语言模型(LLM)的进展带来了显著的能力,但其内部机制仍很大程度上未知。为理解这些模型,我们需要厘清单个神经元的功能及其对网络的贡献。本文引入一种新颖的自动化方法,旨在将可解释性技术扩展到 LLM 内大量神经元上,使其更具可解释性并最终安全。常规方法需要检查具有强神经元激活的样本并人工识别模式以破译神经元所响应的概念。我们提出 Neuron to Graph(N2G),一种创新工具,可从神经元所训练的数据集中自动提取其行为并转化为可解释的图。N2G 使用截断与显著性方法仅强调与神经元最相关的 token,同时用多样化样本丰富数据集样本以更好涵盖神经元行为的全谱。这些图可可视化以辅助研究人员的手动解释,并可在文本上生成 token 激活用于通过与神经元真实激活比较的自动验证,我们用此表明该模型比两种基线方法更擅长预测神经元激活。我们还展示了所生成的图表示如何被灵活用于促进可解释性研究的进一步自动化,通过搜索具有特定属性的神经元,或以编程方式相互比较神经元以识别相似神经元。我们的方法易于扩展到使用单个 Tesla T4 GPU 为 6 层 Transformer 模型中的所有神经元构建图表示,从而具有广泛可用性。我们在 https://github.com/alexjfoote/Neuron2Graph 发布代码与使用说明。
引用
@article{arxiv.2305.19911,
title = {Neuron to Graph: Interpreting Language Model Neurons at Scale},
author = {Alex Foote and Neel Nanda and Esben Kran and Ioannis Konstas and Shay Cohen and Fazl Barez},
journal= {arXiv preprint arXiv:2305.19911},
year = {2023}
}