国际象棋神经网络中习得的前瞻性证据
机器学习
2024-06-05 v1 人工智能
摘要
神经网络是否学会了“在实战中”实现诸如前瞻或搜索之类的算法?还是它们纯粹依赖于简单启发式规则的集合?我们展示了当前最强的神经国际象棋引擎Leela Chess Zero的策略网络中习得的前瞻性证据。我们发现Leela内部表示了未来的最优走法,并且这些表示对其在某些棋盘状态下的最终输出至关重要。具体来说,我们利用Leela是一个将每个棋盘格视为语言模型中token的Transformer这一事实,并给出三条证据线:(1) 未来走法的某些格上的激活在因果上异常重要;(2) 我们发现了将重要信息“向前和向后传递”的注意力头,例如,从未来走法的格到较早走法的格;(3) 我们训练了一个简单的探针,可以以92%的准确率预测2步后的最优走法(在Leela找到单一最佳路线的棋盘状态下)。这些发现是神经网络中习得的前瞻性的存在性证明,并且可能是朝着更好地理解其能力迈出的一步。
引用
@article{arxiv.2406.00877,
title = {Evidence of Learned Look-Ahead in a Chess-Playing Neural Network},
author = {Erik Jenner and Shreyas Kapur and Vasil Georgiev and Cameron Allen and Scott Emmons and Stuart Russell},
journal= {arXiv preprint arXiv:2406.00877},
year = {2024}
}
备注
Project page: https://leela-interp.github.io/