国际象棋 Transformer 中的组合性发现:基于 OOD 测试
机器学习
2025-10-24 v1
摘要
国际象棋是需要严谨推理和长期规划的典型任务。现代决策 Transformer 通过类似 LLM 的方式训练,能够学习到 competence 的游戏水平,但究竟是否真正捕捉到国际象棋规则尚不明确。为此,我们训练了一个 2.7 亿参数的国际象棋 Transformer,并在旨在揭示系统性泛化失效的 OOD 场景中进行测试。我们的分析表明,Transformer 表现出组合泛化,体现在规则外推方面:它们在 training data 之外的情境下,始终选择合法 move,严守基本语法规则。此外,它们还为 OOD 棋谜生成 high-quality move。在更具挑战性的测试中,我们评估了包括 Chess960(Fischer Random Chess)在内的 variant——这是一种随机化棋子起始位置的国际象棋变体。我们发现尽管模型展现出 basic strategy adaptation,但在 symbolic AI 进行显式 search 的算法中仍处于劣势;然而,当对抗 Lichess 用户时,差距较小。更重要的是,训练 dynamics 显示模型最初仅学会移动自身棋子,这暗示了该模型逐渐形成对游戏的组合性理解。
引用
@article{arxiv.2510.20783,
title = {Out-of-distribution Tests Reveal Compositionality in Chess Transformers},
author = {Anna Mészáros and Patrik Reizinger and Ferenc Huszár},
journal= {arXiv preprint arXiv:2510.20783},
year = {2025}
}