利用深度Q网络改进Wizard吃墩游戏的叫牌与出牌策略
机器学习
2022-05-30 v1
摘要
本工作中,具有独立叫牌与出牌阶段的吃墩游戏Wizard被建模为两个交错的部分可观测马尔可夫决策过程(POMDP)。深度Q网络(DQN)被用于赋能自我改进智能体,其能够应对高度非平稳环境带来的挑战。为在算法间进行比较,我们监测叫牌数与吃墩数之间的准确率,该指标与实际奖励强相关,并提供了明确的上、下性能界限。训练后的DQN智能体在自博弈中达到66%至87%的准确率,超越了随机基线与基于规则的启发式方法。所进行的分析还揭示了叫牌阶段关于玩家位置的强信息不对称性。为克服不完美信息游戏所缺失的马尔可夫性质,我们实现了长短期记忆(LSTM)网络,以将历史信息整合进决策过程。此外,通过对环境状态进行采样并由此将游戏转化为完美信息设定,我们执行了前向树搜索。令我们惊讶的是,这两种方法均未超越基础DQN智能体的性能。
引用
@article{arxiv.2205.13834,
title = {Improving Bidding and Playing Strategies in the Trick-Taking game Wizard using Deep Q-Networks},
author = {Jonas Schumacher and Marco Pleines},
journal= {arXiv preprint arXiv:2205.13834},
year = {2022}
}
备注
Accepted to IEEE CoG 2022, 8 pages, 17 figures