中文

在 Pommerman 中结合对手模型考察蒙特卡洛树搜索

人工智能 2023-05-23 v1

摘要

结合强化学习,蒙特卡洛树搜索已在象棋、将棋和围棋等游戏中以极少乃至无需先验领域知识的情况下超越人类顶尖高手。然而,大多数经典应用场景仅涉及至多两名玩家。将搜索扩展到任意数量玩家会带来计算挑战,尤其在需较长时域规划决策时。本工作中,我们研究将一般和多人博弈转化为单人及双人博弈的技术,其中其他智能体按给定对手模型行动。为评估,我们聚焦于具部分可观测性、长时域与稀疏奖励的困难 Pommerman 环境。结合我们的搜索方法,我们考察了基于启发式与自博弈的对手建模现象。总体而言,我们在监督学习与强化学习设定下均展示了多人搜索变体的有效性。

关键词

引用

@article{arxiv.2305.13206,
  title  = {Know your Enemy: Investigating Monte-Carlo Tree Search with Opponent Models in Pommerman},
  author = {Jannis Weil and Johannes Czech and Tobias Meuser and Kristian Kersting},
  journal= {arXiv preprint arXiv:2305.13206},
  year   = {2023}
}

备注

Accepted at the Adaptive and Learning Agents Workshop (ALA) at AAMAS 2023