从人类数据学习 Skat 的策略
人工智能
2019-05-28 v1
摘要
大型不完美信息博弈中的决策十分困难。得益于扑克领域的近期成功,反事实遗憾最小化(CFR)方法一直处于这些博弈研究的前沿。然而,大型博弈中的多数成功都依赖于前向模型与强大的状态抽象。在桥牌或 Skat 等吃墩纸牌游戏中,庞大的信息集以及在不完全确定状态的情况下无法推进模拟,使得前向搜索存在问题。此外,由于每位玩家的精确手牌直接影响着走法价值,状态抽象尤其难以构建。本文中,我们探索使用深度神经网络(DNN)从人类博弈数据学习 Skat 的无模型策略。我们通过引入以下方法,产出了用于叫牌和游戏声明的新最先进系统:a) 直接调节叫牌者的激进程度;b) 基于期望值声明游戏,同时缓解罕见状态-动作对的问题。尽管通过模仿学习的出牌策略略弱于当前最佳的基于搜索的方法,但其运行速度快数个数量级。我们还探索了如何在强化学习设定中直接从经验学习这些策略,并讨论了为此任务引入人类数据的价值。
引用
@article{arxiv.1905.10907,
title = {Learning Policies from Human Data for Skat},
author = {Douglas Rebstock and Christopher Solinas and Michael Buro},
journal= {arXiv preprint arXiv:1905.10907},
year = {2019}
}
备注
accepted by IEEE Conference on Games 2019 (CoG-2019)