中文

DouRN:通过残差神经网络改进 DouZero

人工智能 2024-03-22 v1 机器学习

摘要

深度强化学习在非完美信息游戏中取得了显著进展,但在纸牌游戏斗地主中的表现仍不令人满意。斗地主与传统游戏不同,它涉及三名玩家,融合了合作与对抗的元素,导致状态和动作空间巨大。2021 年,一个名为 DouZero 的斗地主程序通过利用传统的蒙特卡洛方法和多层感知机,在没有先验知识的情况下超越了以往的模型。在此工作的基础上,我们的研究将残差网络融入模型,探索了不同的架构设计,并进行了多角色测试。我们的发现表明,该模型在相同的训练时间内显著提高了胜率。此外,我们引入了一个叫分系统来辅助智能体决定是否成为地主。凭借这些增强,我们的模型持续优于现有版本的 DouZero,甚至超越了经验丰富的人类玩家。\footnote{源代码可在 \url{https://github.com/Yingchaol/Douzero_Resnet.git} 获取。}

关键词

引用

@article{arxiv.2403.14102,
  title  = {DouRN: Improving DouZero by Residual Neural Networks},
  author = {Yiquan Chen and Yingchao Lyu and Di Zhang},
  journal= {arXiv preprint arXiv:2403.14102},
  year   = {2024}
}