ScrofaZero:通过深度强化学习掌握吃墩扑克游戏贡珠
计算机科学与博弈论
2021-02-16 v1 人工智能
神经与进化计算
摘要
人们在博弈 AI 方面取得了显著进展,尤其是在完美信息博弈领域。然而,吃墩扑克游戏作为一种流行的非完美信息博弈形式,长期以来被视为一项挑战。由于吃墩游戏不仅需要高水平的推理,还需要推断才能精通,因此它可成为非完美信息博弈 AI 的新里程碑。我们研究贡珠(Gongzhu),一种类似于但略简于桥牌的吃墩游戏。尽管如此,贡珠的策略对人类和计算机玩家都足够复杂。我们通过深度强化学习从白板(tabula rasa)训练出强大的贡珠 AI ScrofaZero,而此前少数解决吃墩扑克游戏的尝试很少利用神经网络的表征能力。此外,我们引入了针对非完美信息游戏的新技术,包括分层采样、重要性加权、等价类积分、贝叶斯推断等。我们的 AI 能达到人类专家水平的表现。构建该程序的方法论可轻易迁移至广泛的吃墩游戏。
引用
@article{arxiv.2102.07495,
title = {ScrofaZero: Mastering Trick-taking Poker Game Gongzhu by Deep Reinforcement Learning},
author = {Naichen Shi and Ruichen Li and Sun Youran},
journal= {arXiv preprint arXiv:2102.07495},
year = {2021}
}
备注
The very first versoin. Will be improved in the future