从随机对弈中掌握 Sungka 游戏
机器学习
2019-05-20 v1 人工智能
机器学习
摘要
强化学习近期的工作表明,仅通过自我对弈进行学习不仅是可能的,还可能产生人类从未想到的新策略。然而,被表述为两名玩家之间博弈的优化方法需要仔细调参以防止次优结果。因此,我们将随机对弈视为一种替代方法。本文中,我们训练一个 DQN 智能体来玩 Sungka——一种两名玩家轮流进行的棋盘游戏,玩家竞相获得比对方更多的石子。我们表明,即使仅使用纯随机对弈,我们的训练算法也能非常快速地收敛且稳定。此外,我们在多个基线对手上测试了训练后的智能体,并展示了其持续战胜这些对手的能力。
引用
@article{arxiv.1905.07102,
title = {Mastering the Game of Sungka from Random Play},
author = {Darwin Bautista and Raimarc Dionido},
journal= {arXiv preprint arXiv:1905.07102},
year = {2019}
}
备注
6 pages, 7 figures