中文

严格评估神经元自然语言解释

计算与语言 2023-09-20 v1

摘要

自然语言是一种吸引人的媒介,用于解释大语言模型如何处理与存储信息,但评估此类解释的忠实性颇具挑战。为助益于此,我们针对声称单个神经元在文本输入中表示某一概念的自然语言解释,开发了两种评估模式。在观测模式中,我们评估如下断言:神经元 aa 仅在且恰在指代由所提解释 EE 所拣选概念的输入字符串上激活。在干预模式中,我们将 EE 理解为断言神经元 aa 是由 EE 所表示概念的一个因果中介。我们将我们的框架应用于 Bills 等人(2023)的 GPT-4 生成的 GPT-2 XL 神经元解释,并表明即便最自信的解释也具有高错误率且几乎无因果效力。我们在文末批判性地评估自然语言是否为解释的良好选择以及神经元是否为最佳分析层级。

关键词

引用

@article{arxiv.2309.10312,
  title  = {Rigorously Assessing Natural Language Explanations of Neurons},
  author = {Jing Huang and Atticus Geiger and Karel D'Oosterlinck and Zhengxuan Wu and Christopher Potts},
  journal= {arXiv preprint arXiv:2309.10312},
  year   = {2023}
}