侦察盲棋中的深度概览蒙特卡洛规划
人工智能
2021-11-02 v2 机器学习
摘要
本文提出了面向大型不完美信息博弈的深度概览蒙特卡洛规划(DSMCP)。该算法利用无权重粒子滤波器构建信念状态,并通过从信念状态中抽取样本开始的模拟对局进行规划。该算法通过对“概览”(synopses,一种新颖的信息状态随机抽象)进行推断来处理不确定性。DSMCP 是程序 Penumbra 的基础,该程序在 2020 年官方侦察盲棋竞赛中击败了其他 33 个程序而获胜。本文还评估了结合谨慎性、多疑性以及一种新颖 bandit 算法的算法变体。此外,本文利用逐位显著性统计对 Penumbra 中使用的概览特征进行了审查。
引用
@article{arxiv.2110.01810,
title = {Deep Synoptic Monte Carlo Planning in Reconnaissance Blind Chess},
author = {Gregory Clark},
journal= {arXiv preprint arXiv:2110.01810},
year = {2021}
}
备注
Accepted to NeurIPS 2021