Polygames:改进的Zero学习
机器学习
2020-01-28 v1 机器学习
摘要
自DeepMind的AlphaZero以来,Zero学习迅速成为许多棋盘游戏的最先进方法。它可通过全卷积结构(无全连接层)得到改进。利用此种架构加全局池化,我们可以创建独立于棋盘大小的智能体。通过在训练期间跟踪最佳检查点并与之对抗训练,可使训练更加鲁棒。利用这些特性,我们发布了用于Zero学习的框架Polygames,及其游戏库与检查点。我们在19x19的六子棋(Hex)中战胜了强人类选手,该游戏常被认为对Zero学习而言难以处理;并在Havannah中获胜。我们还在TAAI竞赛中获得了若干第一名。
引用
@article{arxiv.2001.09832,
title = {Polygames: Improved Zero Learning},
author = {Tristan Cazenave and Yen-Chi Chen and Guan-Wei Chen and Shi-Yu Chen and Xian-Dong Chiu and Julien Dehos and Maria Elsa and Qucheng Gong and Hengyuan Hu and Vasil Khalidov and Cheng-Ling Li and Hsin-I Lin and Yu-Jin Lin and Xavier Martinet and Vegard Mella and Jeremy Rapin and Baptiste Roziere and Gabriel Synnaeve and Fabien Teytaud and Olivier Teytaud and Shi-Cheng Ye and Yi-Jun Ye and Shi-Jim Yen and Sergey Zagoruyko},
journal= {arXiv preprint arXiv:2001.09832},
year = {2020}
}