基于 Ludii 与 Polygames 的通用博弈深度学习
人工智能
2021-01-26 v1
摘要
蒙特卡洛树搜索与深度神经网络相结合、并通过自我博弈训练的方法,已在许多棋类游戏中取得了自动博弈的顶尖结果。训练和搜索算法并非针对特定游戏,但这些方法所应用的每个单独游戏仍需要领域知识来实现游戏规则,并构建神经网络的架构——尤其是其输入和输出张量的形状。Ludii 是一个通用游戏系统,已包含超过 500 种不同的游戏,并凭借其强大且用户友好的游戏描述语言而快速扩展。Polygames 是一个带有训练和搜索算法的框架,已为若干棋类游戏生成了超人类水平的玩家。本文描述了 Ludii 与 Polygames 之间桥梁的实现,使 Polygames 能够针对通过 Ludii 实现和运行的游戏训练和评估模型。我们不再需要任何游戏特定的领域知识,而是利用我们对 Ludii 系统及其抽象状态和动作表示的领域知识,编写可自动确定 Ludii 中实现的任何游戏的输入和输出张量适当形状的函数。我们描述了在多种不同棋类游戏中短期训练的实验结果,并讨论了若干开放问题和未来研究途径。
引用
@article{arxiv.2101.09562,
title = {Deep Learning for General Game Playing with Ludii and Polygames},
author = {Dennis J. N. J. Soemers and Vegard Mella and Cameron Browne and Olivier Teytaud},
journal= {arXiv preprint arXiv:2101.09562},
year = {2021}
}