中文

使用深度强化学习构建三人麻将 AI

人工智能 2022-05-17 v3 机器学习

摘要

麻将是一种于 19 世纪末在中国发展起来的流行多人不完全信息游戏,具有一些对 AI 研究非常具有挑战性的特征。三麻作为日本立直麻将的三人变体,具有独特特征,包括更少的牌张,因而更具攻击性的打法风格。因此它本身具有挑战性且极具研究价值,但尚未被探索。在本文中,我们提出 Meowjong,一个使用深度强化学习的三麻 AI。我们定义了一种信息丰富且紧凑的二维数据结构来编码三麻游戏中的可观测信息。我们预训练了 5 个卷积神经网络(CNN)用于三麻的 5 种动作——打牌、碰、杠、北和立直,并通过使用蒙特卡洛策略梯度方法的自玩强化学习来增强主要动作(即打牌模型)的模型。Meowjong 的模型通过监督学习取得了与四人麻将 AI 相当的测试准确率,并从强化学习中获得显著的进一步提升。作为三麻中首个 AI,我们声称 Meowjong 是该游戏中的最先进技术(state-of-the-art)。

关键词

引用

@article{arxiv.2202.12847,
  title  = {Building a 3-Player Mahjong AI using Deep Reinforcement Learning},
  author = {Xiangyu Zhao and Sean B. Holden},
  journal= {arXiv preprint arXiv:2202.12847},
  year   = {2022}
}

备注

8 pages, 9 figures