用于斗地主的组合 Q-learning
机器学习
2019-02-20 v2 人工智能
机器学习
摘要
深度强化学习(DRL)近年来备受关注,已被证明能够以达到或超越人类水平的程度游玩 Atari 游戏和围棋。然而,这些游戏被假定具有较小的固定动作数量,并可用简单的 CNN 网络训练。在本文中,我们研究一类流行的亚洲纸牌游戏斗地主,其中两个对抗性的智能体组必须在每个时间步考虑大量出牌组合,导致动作数量巨大。我们提出一种处理组合动作的新方法,称为组合 Q-learning(CQL)。我们采用两阶段网络来缩减动作空间,并利用顺序不变的最大池化操作来提取基本动作之间的关系。结果表明,我们的方法优于朴素 Q-learning 和 A3C 等最先进的方法。我们开发了易于使用的纸牌游戏环境,并从零开始以对抗方式训练所有智能体,仅利用游戏规则知识,并验证我们的智能体与人类具有可比性。用于复现所有报告结果的代码将在线提供。
引用
@article{arxiv.1901.08925,
title = {Combinational Q-Learning for Dou Di Zhu},
author = {Yang You and Liangwei Li and Baisong Guo and Weiming Wang and Cewu Lu},
journal= {arXiv preprint arXiv:1901.08925},
year = {2019}
}
备注
8 pages