中文

针对不完美信息游戏的 AlphaZero 多状态聚合策略评估:MAPLE 方法

人工智能 2026-05-26 v1 机器学习

摘要

不完美信息游戏 (IIGs) 具有挑战性,因为玩家必须在不完全观察真实游戏状态的情况下做出决策。虽然 AlphaZero 在完美信息游戏中取得了显著成功,但将其扩展到 IIGs 仍然困难。现有的基于搜索的方法,如完美信息蒙特卡洦 (PIMC),受制于策略融合;而信息集蒙特卡洞树搜索 (IS-MCTS) 组合神经网络时计算成本极高。本文提出一种多状态聚合策略评估方法 (MAPLE),这是一种树搜索方法,通过在单个搜索树中聚合来自多个抽样世界状态的策略和价值评估,兼具 PIMC 和 IS-MCTS 的优势,同时保持可控的计算成本。我们进一步采用基于 Siamese 的抽样策略,从信息集中选择具有信息量的世界状态。在 Phantom Go 和 Dark Hex 上的实验表明,MAPLE 相较于基于 PIMC 的 AlphaZero 基线显著优异,分别实现了 291 和 136 的 Elo 积分提升。这一结果表明,MAPLE 是一种有效的 AlphaZero 风格学习在不完美信息游戏中的方法。

关键词

引用

@article{arxiv.2605.24139,
  title  = {MAPLE: Multi-State Aggregated Policy Evaluation for AlphaZero in Imperfect-Information Games},
  author = {Qian-Rong Li and Hung Guei and I-Chen Wu and Ti-Rong Wu},
  journal= {arXiv preprint arXiv:2605.24139},
  year   = {2026}
}

备注

Accepted by the IEEE Conference on Games (IEEE CoG 2026)