中文

用于斗地主的组合 Q-learning

机器学习 2019-02-20 v2 人工智能 机器学习

摘要

深度强化学习(DRL)近年来备受关注,已被证明能够以达到或超越人类水平的程度游玩 Atari 游戏和围棋。然而,这些游戏被假定具有较小的固定动作数量,并可用简单的 CNN 网络训练。在本文中,我们研究一类流行的亚洲纸牌游戏斗地主,其中两个对抗性的智能体组必须在每个时间步考虑大量出牌组合,导致动作数量巨大。我们提出一种处理组合动作的新方法,称为组合 Q-learning(CQL)。我们采用两阶段网络来缩减动作空间,并利用顺序不变的最大池化操作来提取基本动作之间的关系。结果表明,我们的方法优于朴素 Q-learning 和 A3C 等最先进的方法。我们开发了易于使用的纸牌游戏环境,并从零开始以对抗方式训练所有智能体,仅利用游戏规则知识,并验证我们的智能体与人类具有可比性。用于复现所有报告结果的代码将在线提供。

关键词

引用

@article{arxiv.1901.08925,
  title  = {Combinational Q-Learning for Dou Di Zhu},
  author = {Yang You and Liangwei Li and Baisong Guo and Weiming Wang and Cewu Lu},
  journal= {arXiv preprint arXiv:1901.08925},
  year   = {2019}
}

备注

8 pages