中文

ExIt-OOS:面向不完美信息博弈中从规划学习的方法

人工智能 2018-10-26 v2 计算机科学与博弈论 机器学习

摘要

当前在许多重要完美信息博弈(包括国际象棋和围棋)中最佳的水平,将规划与深度强化学习以及自我对弈相结合。我们将此方法扩展到不完美信息博弈,并提出 ExIt-OOS,一种在专家迭代(Expert Iteration)框架内受 AlphaZero 启发、用于博弈不完美信息博弈的新方法。我们使用在线结果采样(Online Outcome Sampling),一种用于不完美信息博弈的在线搜索算法,来替代 MCTS。在在线训练时,我们的神经策略被用于提高 OOS 中模拟(playout)的准确性,从而形成一个针对不完美信息博弈的学习与规划反馈回路。

关键词

引用

@article{arxiv.1808.10120,
  title  = {ExIt-OOS: Towards Learning from Planning in Imperfect Information Games},
  author = {Andy Kitchen and Michela Benedetti},
  journal= {arXiv preprint arXiv:1808.10120},
  year   = {2018}
}

备注

8 pages. 1 figure, 5 tables