N2G:一种用于量化大语言模型中可解释神经元表征的可扩展方法
机器学习
2023-04-26 v1
摘要
理解语言模型中单个神经元的功能对于机制可解释性研究至关重要。我们提出(神经元到图),这是一种以神经元及其数据集样本为输入,并自动将该神经元在这些样本上的行为提炼为可解释图的工具。与当前的人工方法相比,这提供了一种劳动强度更低来解释神经元的方法,能更好地将这些方法扩展到大型语言模型(LLMs)。我们使用截断和显著性方法仅呈现重要词元,并用更多样化的样本扩充数据集样本,以更好地捕捉神经元行为的范围。这些图可被可视化以帮助研究人员进行人工解释,但也可以输出文本上的词元激活来与神经元的真实激活进行比较以实现自动验证。N2G通过允许我们将LLM中的神经元转换为具有可度量质量的可解释表征,代表了迈向可扩展可解释性方法的一步。
引用
@article{arxiv.2304.12918,
title = {N2G: A Scalable Approach for Quantifying Interpretable Neuron Representations in Large Language Models},
author = {Alex Foote and Neel Nanda and Esben Kran and Ionnis Konstas and Fazl Barez},
journal= {arXiv preprint arXiv:2304.12918},
year = {2023}
}
备注
To be published at ICLR 2023 Workshop on Trustworthy and Reliable Large-Scale Machine Learning Models