中文

自动发现 OthelloGPT 中的基于规则的神经元

机器学习 2025-11-04 v1 人工智能

摘要

OthelloGPT 是一个用于预测 Othello 棋局中有效走法的变换模型,为可解释性研究提供了理想的测试基准。该模型足够复杂,以展现丰富的计算模式,同时又建立在基于规则的棋局逻辑之上,能够实现有意义的逆向工程。我们提出了一种基于决策树的自动方法,用于识别和解释编码基于规则棋局逻辑的多层感知器(MLP)神经元。该方法通过训练回归决策树将棋盘状态映射到神经元激活值,然后提取神经元高度活跃的决策路径,将其转换为人类可读的逻辑形式。这些描述揭示了高度可解释的模式;例如,一些神经元专门检测对角线走法何时合法的检测。我们的发现表明,大约有一半的第 5 层神经元可以通过紧凑、基于规则的决策树准确描述(913 个神经元的 R² 值大于 0.7),而其余神经元可能参与更分布式或非基于规则的计算。我们通过针对性干预验证了由决策树识别的模式的因果相关性。对于特定方格、特定棋局模式,我们会消灭对应这些模式的神经元,并发现相对于控制模式,这些模式下模型预测有效走法能力约降低 5-10 倍。为促进未来工作,我们提供了一个将基于规则的游戏行为映射到其实现神经元的 Python 工具,为研究人员提供资源,以测试其可解释性方法是否恢复有意义的计算结构。

关键词

引用

@article{arxiv.2511.00059,
  title  = {Automatically Finding Rule-Based Neurons in OthelloGPT},
  author = {Aditya Singh and Zihang Wen and Srujananjali Medicherla and Adam Karvonen and Can Rager},
  journal= {arXiv preprint arXiv:2511.00059},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop Mechanistic interpretability