中文

在观测空间中基于 Transformer 的规划及其在吃墩纸牌游戏中的应用

人工智能 2024-04-23 v1 机器学习

摘要

传统搜索算法应用于可能潜在状态和轨迹数量非常庞大的非完全信息博弈时存在问题。这一挑战在吃墩纸牌游戏中尤为明显。虽然完美信息蒙特卡洛(PIMC)搜索等状态采样技术在这些场景中取得了成功,但它们仍然存在主要局限性。我们提出了生成式观测蒙特卡洛树搜索(GO-MCTS),它利用特定于博弈的模型生成的观测序列上的MCTS。该方法在观测空间内执行搜索,并使用仅依赖于智能体观测的模型来推进搜索。此外,我们证明了transformer非常适合作为此背景下的生成模型,并展示了通过基于群体的自博弈迭代训练transformer的过程。GO-MCTS的有效性在多种非完全信息博弈中得到了证明,例如红心大战、斯卡特和“The Crew: The Quest for Planet Nine”,并取得了可喜的结果。

关键词

引用

@article{arxiv.2404.13150,
  title  = {Transformer Based Planning in the Observation Space with Applications to Trick Taking Card Games},
  author = {Douglas Rebstock and Christopher Solinas and Nathan R. Sturtevant and Michael Buro},
  journal= {arXiv preprint arXiv:2404.13150},
  year   = {2024}
}