中文

在 Tablut 上复现 AlphaZero:基于自我对弈强化学习的非对称棋盘游戏

机器学习 2026-04-08 v1

摘要

本工作探讨了将 AlphaZero 强化学习算法适用于 Tablut 的可能性——这是一种包含不平等棋子数量和不同玩家目标(王车获胜 vs 王车逃脱)的历史性非对称棋盘游戏。虽然原始 AlphaZero 架构成功地为对称游戏利用单一策略和价值头,但将其应用于非对称环境会迫使网络学习两个相互冲突的评估函数,从而可能降低学习效率和性能。为此,我们修改了核心架构,为每个玩家角色使用独立的策略和价值头,同时保持共享的残差主干以学习通用棋盘特征。训练过程中,引入的非对称结构导致了训练不稳定,尤其是攻击方与防御方角色之间的灾难性遗忘现象。我们通过应用 C4 数据增强、增加回放缓冲区大小,并让模型以随机抽样的过去检查点进行对弈等方式来缓解这些问题。经过超过 100 次自我对弈迭代,修改后的模型表现出稳定的改进,达到了 1235 的 BayesElo 评级,相对于随机初始化的基线。训练指标还显示出策略熵和平均剩余棋子数量显著下降,反映出越来越聚焦和决定性的游戏风格。最终,实验表明,只要采用独立的策略/价值头并运用稳健的加固技术,AlphaZero 的自我对弈框架即可成功迁移到高度非对称的游戏中。

关键词

引用

@article{arxiv.2604.05476,
  title  = {Reproducing AlphaZero on Tablut: Self-Play RL for an Asymmetric Board Game},
  author = {Tõnis Lees and Tambet Matiisen},
  journal= {arXiv preprint arXiv:2604.05476},
  year   = {2026}
}

备注

For the code see https://github.com/tonislees/TablutZero