同时行动博弈中蒙特卡洛树搜索的收敛性
计算机科学与博弈论
2013-12-16 v2
摘要
我们研究了具有完美信息和同时行动的零和扩展式博弈中的蒙特卡洛树搜索 (MCTS)。我们提出了适用于此类博弈的 MCTS 算法通用模板,该模板可通过各种选择方法进行实例化。我们形式化地证明了:如果某种选择方法在矩阵博弈中是 -Hannan 一致的,并满足额外的探索要求,那么该 MCTS 算法最终将收敛到扩展式博弈的近似纳什均衡 (NE)。我们使用遗憾匹配 (regret matching) 和 Exp3 作为选择方法,在随机生成的博弈和经验选定的最坏情况博弈上对这一主张进行了实证评估。我们确认了形式化结果,并表明额外的 MCTS 变体在评估的博弈中也收敛到近似 NE。
引用
@article{arxiv.1310.8613,
title = {Convergence of Monte Carlo Tree Search in Simultaneous Move Games},
author = {Viliam Lisý and Vojtěch Kovařík and Marc Lanctot and Branislav Bošanský},
journal= {arXiv preprint arXiv:1310.8613},
year = {2013}
}
备注
NIPS 2013 paper including appendix