侦察盲棋中基于观测的监督与强化学习
人工智能
2022-08-04 v1
摘要
在这项工作中,我们调整了受原始 AlphaGo 系统启发的训练方法来游玩不完全信息博弈侦察盲棋(Reconnaissance Blind Chess)。仅使用观测而非游戏状态的完整描述,我们首先在公开可用的对局记录上训练一个监督智能体。接下来,我们通过基于策略内强化学习算法 Proximal Policy Optimization 的自博弈提升该智能体的性能。我们不使用任何搜索以避免由游戏状态部分可观测性引起的问题,并且在游玩时仅使用策略网络生成走法。通过该方法,我们在 RBC 排行榜上取得了 1330 的 ELO,在撰写本文时使我们的智能体位列第 27 名。我们观察到自博弈显著提升了性能,且智能体在无搜索、不对真实游戏状态做假设的情况下表现尚可。
引用
@article{arxiv.2208.02029,
title = {Supervised and Reinforcement Learning from Observations in Reconnaissance Blind Chess},
author = {Timo Bertram and Johannes Fürnkranz and Martin Müller},
journal= {arXiv preprint arXiv:2208.02029},
year = {2022}
}
备注
4 Pages, IEEE Conference on Games 2022 short paper