中文

ScrofaZero:通过深度强化学习掌握吃墩扑克游戏贡珠

计算机科学与博弈论 2021-02-16 v1 人工智能 神经与进化计算

摘要

人们在博弈 AI 方面取得了显著进展,尤其是在完美信息博弈领域。然而,吃墩扑克游戏作为一种流行的非完美信息博弈形式,长期以来被视为一项挑战。由于吃墩游戏不仅需要高水平的推理,还需要推断才能精通,因此它可成为非完美信息博弈 AI 的新里程碑。我们研究贡珠(Gongzhu),一种类似于但略简于桥牌的吃墩游戏。尽管如此,贡珠的策略对人类和计算机玩家都足够复杂。我们通过深度强化学习从白板(tabula rasa)训练出强大的贡珠 AI ScrofaZero,而此前少数解决吃墩扑克游戏的尝试很少利用神经网络的表征能力。此外,我们引入了针对非完美信息游戏的新技术,包括分层采样、重要性加权、等价类积分、贝叶斯推断等。我们的 AI 能达到人类专家水平的表现。构建该程序的方法论可轻易迁移至广泛的吃墩游戏。

关键词

引用

@article{arxiv.2102.07495,
  title  = {ScrofaZero: Mastering Trick-taking Poker Game Gongzhu by Deep Reinforcement Learning},
  author = {Naichen Shi and Ruichen Li and Sun Youran},
  journal= {arXiv preprint arXiv:2102.07495},
  year   = {2021}
}

备注

The very first versoin. Will be improved in the future