中文

Chessformer:用于棋局建模的统一架构

机器学习 2026-05-20 v1

摘要

棋类问题长期以来作为人工智能的典型测试基准,但其核心任务的建模方法却各不相同。最大化棋力、预测人类下棋以及实现可解释性通常分别采用不同的架构,而这些设计往往不符合领域几何结构。这自然提出了一个问题:这些目标是否需要独立的建模范式,还是是否存在单一的架构能够同时支持它们。我们引入 Chessformer,一种统一架构,在棋局建模的三个核心目标上均取得了状态突破。Chessformer 是一种仅包含编码器的 transformer,將棋盘格子表示为 token,增强自注意力机制,引入称为几何注意力偏置(GAB)的动态位置编码,以适应领域特定的几何结构,并采用注意力机制的 source-destination 策略头进行动作预测。我们对 Chessformer 进行了三方面的评估:首先,我们开发了 \maiathree 系列模型用于人类棋步预测,达到 57.1% 的步法匹配准确率,显著优于前所未有的状态,同时参数数量不到原来的四分之一。其次,我们将 Chessformer 集成到 Leela Chess Zero 中,这是一个领先的开源棋引擎,使其在主要计算机棋类比赛中战胜 Stockfish,棋力提升超过 100 档。最后,我们表明 Chessformer 的格子 token 设计使得注意力模式和激活值直接可归因于棋盘格子,实现了细粒度的可解释性分析,而先前的架构自然不支持此类分析。更广泛地说,我们的结果表明,将模型的 tokenization、位置编码和输出设计与领域底层结构对齐,可实现性能、人类兼容性和可解释性的同步提升。

关键词

引用

@article{arxiv.2605.19091,
  title  = {Chessformer: A Unified Architecture for Chess Modeling},
  author = {Daniel Monroe and George Eilender and Philip Chalmers and Zhenwei Tang and Ashton Anderson},
  journal= {arXiv preprint arXiv:2605.19091},
  year   = {2026}
}

备注

International Conference in Learning Representations (2026)