中文

追踪大师级国际象棋对弈Transformer的思维过程

机器学习 2026-04-14 v1

摘要

尽管现代Transformer神经网络在国际象棋和其他推理任务中达到了大师级水平,但其内部计算过程在很大程度上仍然不透明。聚焦于Leela Chess Zero (LC0),我们引入了一个稀疏分解框架,通过用稀疏替换层分解其MLP和注意力模块来解释其内部计算,该框架捕捉了LC0的主要计算过程。我们进行了一个详细的案例研究,表明这些路径揭示了丰富的、可解释的、可经验验证的战术考量。我们进一步引入了三个定量指标,并表明LC0表现出与其策略头架构的归纳偏差一致的并行推理行为。据我们所知,这是第一项在Transformer的MLP和注意力模块上分解其内部计算以实现可解释性的工作。将稀疏替换层和因果干预相结合应用于LC0,提供了对高级战术推理的全面理解,为超人系统的底层机制提供了关键见解。我们的代码可在https://github.com/JacklE0niden/Leela-SAEs获取。

关键词

引用

@article{arxiv.2604.10158,
  title  = {Tracing the Thought of a Grandmaster-level Chess-Playing Transformer},
  author = {Rui Lin and Zhenyu Jin and Guancheng Zhou and Xuyang Ge and Wentao Shu and Jiaxing Wu and Junxuan Wang and Zhengfu He and Junping Zhang and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2604.10158},
  year   = {2026}
}