中文

利用电路探测揭示Transformer中的中间变量

计算与语言 2025-02-13 v3

摘要

神经网络模型在多种复杂任务上取得了高性能,但其实现的算法却以难以解释而著称。为了理解这些算法,常常需要假设网络计算中所涉及的中间变量。例如,语言模型在生成句子时是否依赖于特定的句法属性?然而,现有的分析工具使得检验此类假设变得困难。我们提出了一种新的分析技术——电路探测(circuit probing)——可自动揭示计算假设中间变量的底层电路。这使得通过针对模型参数的定向消融进行因果分析成为可能。我们将该方法应用于在简单算术任务上训练的模型,证明了其在以下方面的有效性:(1) 解读模型已学习的算法,(2) 揭示模型内的模块化结构,以及 (3) 追踪电路在训练过程中的发展。在这三个实验中,我们展示了电路探测整合并扩展了现有方法的能力,为多种分析提供了统一的方法。最后,我们在真实用例上演示了电路探测:揭示GPT2-Small和Medium中负责主谓一致与反身代词指代的电路。

关键词

引用

@article{arxiv.2311.04354,
  title  = {Uncovering Intermediate Variables in Transformers using Circuit Probing},
  author = {Michael A. Lepori and Thomas Serre and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2311.04354},
  year   = {2025}
}