中文

DouZero+:通过对手建模与教练引导学习改进斗地主 AI

人工智能 2022-04-07 v1 机器学习

摘要

近年来,深度强化学习(DRL)在各种完美与不完全信息博弈中取得了重大突破。在这些博弈中,斗地主作为中国流行的一款纸牌游戏,由于不完全信息、大状态空间、协作要素以及每回合大量可能出牌动作而极具挑战性。最近,一种称为 DouZero 的斗地主 AI 系统被提出。DouZero 采用传统蒙特卡洛方法与深度神经网络并结合自对弈过程进行训练,且不引入人类先验知识的抽象,已超越所有现有的斗地主 AI 程序。在本工作中,我们提出通过将对手建模引入 DouZero 来增强其能力。此外,我们提出一种新颖的教练网络,以进一步提升 DouZero 的性能并加速其训练过程。将上述两种技术集成到 DouZero 中后,我们的斗地主 AI 系统在 Botzone 排行榜上超过 400 个 AI 智能体(包括 DouZero)位居榜首,取得了更优性能。

关键词

引用

@article{arxiv.2204.02558,
  title  = {DouZero+: Improving DouDizhu AI by Opponent Modeling and Coach-guided Learning},
  author = {Youpeng Zhao and Jian Zhao and Xunhan Hu and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2204.02558},
  year   = {2022}
}