在小棋盘上训练,在大棋盘上博弈:基于 AlphaZero 与 GNN 的棋盘游戏规模扩展
机器学习
2021-07-20 v1 人工智能
摘要
博弈棋盘游戏被认为是人类和 AI 研究者面临的一项重大挑战。由于某些复杂棋盘游戏相当难以学习,人类通常从较小棋盘开始对弈,并逐步进阶以掌握更大的棋盘策略。当前大多数负责博弈棋盘游戏的神经网络框架既未进行此类增量学习,也不具备自动扩展规模的能力。在本工作中,我们将棋盘视为图,并在 AlphaZero 框架内结合图神经网络架构以及一些其他创新性改进。我们的 ScalableAlphaZero 能够增量学习在小型棋盘上博弈,并进阶在大型棋盘上博弈。我们的模型可以快速训练以在多种棋盘尺寸上博弈不同的具有挑战性的棋盘游戏,且不使用任何领域知识。我们展示了 ScalableAlphaZero 的有效性,例如表明通过在小型 Othello 棋盘上仅训练三天,它便能在大型棋盘上击败训练了 天以博弈该大型棋盘的 AlphaZero 模型。
引用
@article{arxiv.2107.08387,
title = {Train on Small, Play the Large: Scaling Up Board Games with AlphaZero and GNN},
author = {Shai Ben-Assayag and Ran El-Yaniv},
journal= {arXiv preprint arXiv:2107.08387},
year = {2021}
}