中文

面向决策时规划的更新等价框架

人工智能 2024-05-14 v3 机器学习

摘要

在执行时修订(或构建)策略的过程——称为决策时规划——是在国际象棋和围棋等完美信息博弈中实现超人类表现的关键。近期一系列工作将决策时规划扩展至不完美信息博弈,从而在扑克中取得超人类表现。然而,这些方法涉及求解子博弈,其规模随非公开信息量的增加而迅速增长,当非公开信息量很大时便无助于事。受此问题驱动,我们引入了另一种不基于求解子博弈、而是基于更新等价的决策时规划框架。在此更新等价框架中,决策时规划算法复现末次迭代算法的更新,而后者无需依赖公开信息。这便于扩展到具有大量非公开信息的博弈。利用该框架,我们推导出一种基于镜像下降、可证明可靠的完全合作博弈搜索算法,以及一种基于磁镜像下降的对抗性博弈搜索算法。我们在合作与对抗领域中验证了这些算法的性能,特别是在 Hanabi(完全合作不完美信息博弈搜索的标准基准)中。在此,我们的镜像下降方法在使用少两个数量级搜索时间的同时,达到或超越了基于公开信息搜索的性能。这是基于非公开信息的算法首次在其历史上主导的领域超越基于公开信息的方法。

关键词

引用

@article{arxiv.2304.13138,
  title  = {The Update-Equivalence Framework for Decision-Time Planning},
  author = {Samuel Sokota and Gabriele Farina and David J. Wu and Hengyuan Hu and Kevin A. Wang and J. Zico Kolter and Noam Brown},
  journal= {arXiv preprint arXiv:2304.13138},
  year   = {2024}
}