中文

关于具有交替走步和完全信息的确定性博弈的蒙特卡洛树搜索

概率论 2018-01-25 v2

摘要

我们考虑一种具有交替走步和完全信息的确定性博弈,其问题始终是两位对手中一方的胜利。我们假设该博弈是享有某些独立性性质的随机模型的实现。我们考虑了具有蒙特卡洛树搜索(MCTS)精神的算法,以最佳估计给定位置的极小极大值:它包括从该位置开始,连续模拟nn场精心选择的对局。我们构建了一种算法,该算法在某种意义上是逐步最优的:一旦模拟完前nn场对局,算法便根据前nn场对局提供的统计数据(以及我们对博弈的先验知识),决定如何模拟第(n+1)(n+1)场对局,使得关于所研究位置极小极大值的信息增量最大化。该算法速度极快。我们证明了我们的逐步最优算法并非全局最优,并且即使我们对博弈的先验知识完全无关,它总是在有限步数内收敛。最后,我们在 Pearl 博弈以及 Connect Four 及其某些变体上,使用非常简单且通用的先验知识,将我们的算法与 MCTS 进行了测试。数值结果相当令人失望。然而,我们也展示了一些该算法似乎有效的情况。

关键词

引用

@article{arxiv.1704.04612,
  title  = {On Monte-Carlo tree search for deterministic games with alternate moves and complete information},
  author = {Sylvain Delattre and Nicolas Fournier},
  journal= {arXiv preprint arXiv:1704.04612},
  year   = {2018}
}