中文

DouZero:通过自博弈深度强化学习掌握斗地主

人工智能 2021-06-14 v1 机器学习

摘要

游戏是真实世界的抽象,人工智能体在其中学习与其他智能体竞争与合作。尽管在各种完美信息与不完美信息游戏中已取得显著成就,斗地主(DouDizhu,亦称 Fighting the Landlord)这一三人纸牌游戏仍未被攻克。斗地主是一个极具挑战性的领域,包含竞争、协作、不完美信息、巨大状态空间,尤其具有海量可能动作集,且合法动作随回合变化显著。遗憾的是,现代强化学习算法主要关注简单且小的动作空间, unsurprisingly,在斗地主中未能取得令人满意的进展。本工作中,我们提出一个概念简单却有效的斗地主 AI 系统,即 DouZero,它将传统蒙特卡洛方法与深度神经网络、动作编码及并行执行器相结合。从零开始在配备四块 GPU 的单台服务器上,DouZero 在数天训练内超越了所有现有斗地主 AI 程序,并在 Botzone 排行榜的 344 个 AI 智能体中排名第一。通过构建 DouZero,我们展示了经典蒙特卡洛方法可在具有复杂动作空间的困难领域中取得强劲结果。代码与在线演示已发布于 https://github.com/kwai/DouZero,希望此洞见能激励未来工作。

关键词

引用

@article{arxiv.2106.06135,
  title  = {DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning},
  author = {Daochen Zha and Jingru Xie and Wenye Ma and Sheng Zhang and Xiangru Lian and Xia Hu and Ji Liu},
  journal= {arXiv preprint arXiv:2106.06135},
  year   = {2021}
}

备注

Accepted by ICML 2021