通过深度卷积神经网络构建计算机麻将玩家
人工智能
2019-06-10 v2 机器学习
摘要
不完美信息游戏的评估函数一直难以定义,但对程序的棋力有重大影响。深度学习近年来取得了巨大成就,甚至在围棋游戏中已经超越了顶尖人类玩家的水平。在本文中,我们引入了一种新的数据模型来表示牌桌上可用的不完美信息,并构建了一个精心设计的卷积神经网络用于棋谱训练。我们选择弃牌准确率(也称为一致率)作为本研究的基准。我们在测试数据上的准确率达到 70.44%,而 Mizukami 和 Tsuruoka(2015)报道的 SOTA 基线为 62.1%,且显著高于以往使用深度学习的尝试,这显示了我们新模型的光明潜力。对于 AI 程序的构建,除弃牌策略外,我们对吃、碰、杠和立直等其他动作采用了类似的预测策略。通过简单组合这几个预测网络,且无需任何关于游戏具体规则的知识,我们在最大的日本麻将网站“天凤”上对所得程序进行了实力评估。该程序达到了约 1850 的评分,显著高于平均人类玩家及以往研究中的程序。
引用
@article{arxiv.1906.02146,
title = {Building a Computer Mahjong Player via Deep Convolutional Neural Networks},
author = {Shiqi Gao and Fuminori Okuya and Yoshihiro Kawahara and Yoshimasa Tsuruoka},
journal= {arXiv preprint arXiv:1906.02146},
year = {2019}
}
备注
8 pages