中文

利用图表示增强国际象棋强化学习

机器学习 2024-11-01 v1 人工智能

摘要

掌握游戏是一项艰巨的任务,因为游戏可能极其复杂,并且彼此之间在结构上存在根本差异。虽然 AlphaZero 算法展示了学习从围棋、国际象棋到 Atari 游戏等大量游戏规则和策略的惊人能力,但它对大量计算资源的依赖以及僵化的卷积神经网络(CNN)架构限制了其适应性和可扩展性。一个在 19×1919\times 19 围棋棋盘上训练好的模型,尽管两种围棋变体之间存在相似性,却不能用于在更小的 13×1313\times 13 棋盘上下棋。在本文中,我们聚焦于国际象棋,探索使用更通用的基于图的游戏状态表示,而非基于网格的表示,以引入一种基于图神经网络(GNN)的更通用的架构。我们还扩展了经典的图注意力网络(GAT)层,以纳入边特征,从而自然地提供一种通用的策略输出格式。我们在比初始 AlphaZero 论文更小的网络上进行的实验表明,这种新架构优于具有相似参数量的先前架构,能够将一个数量级更快地提升棋力。我们还表明,该模型在 5×55\times 5 的国际象棋变体上训练后,能够快速微调以在常规 8×88\times 8 棋盘上下棋,这表明该方法具有可观的泛化能力。我们的代码可在 https://github.com/akulen/AlphaGateau 获取。

关键词

引用

@article{arxiv.2410.23753,
  title  = {Enhancing Chess Reinforcement Learning with Graph Representation},
  author = {Tomas Rigaux and Hisashi Kashima},
  journal= {arXiv preprint arXiv:2410.23753},
  year   = {2024}
}