中文

DanZero:利用强化学习精通掼蛋游戏

人工智能 2022-11-01 v1 机器学习

摘要

纸牌游戏AI一直是人工智能研究中的热门课题。近年来,麻将、斗地主和德州扑克等复杂纸牌游戏已被攻克,相应的AI程序已达到人类专家水平。本文致力于为一款更复杂的纸牌游戏掼蛋开发AI程序,其规则类似于斗地主但复杂得多。具体而言,掼蛋所具有的大状态与动作空间、单局长度长以及玩家数量不确定等特性,给AI程序的开发带来了巨大挑战。为解决这些问题,我们提出了首个利用强化学习技术的掼蛋AI程序DanZero。具体地,我们采用分布式框架训练AI系统。在actor进程中,我们精心设计状态特征,智能体通过自博弈生成样本。在learner进程中,模型由深度蒙特卡洛方法更新。使用160个CPU和1个GPU训练30天后,我们得到了DanZero机器人。我们将其与8个基于启发式规则的基线AI程序比较,结果揭示了DanZero的卓越性能。我们还与人类玩家测试了DanZero,展示了其人类水平的性能。

关键词

引用

@article{arxiv.2210.17087,
  title  = {DanZero: Mastering GuanDan Game with Reinforcement Learning},
  author = {Yudong Lu and Jian Zhao and Youpeng Zhao and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2210.17087},
  year   = {2022}
}