用于树搜索的 Bandit 算法
人工智能
2014-08-12 v1
摘要
基于 Bandit 的树搜索方法最近在应用于巨大树(例如围棋 [6])时获得了普及。它们对树的高效探索能够快速返回良好的值,并在提供更多时间时提高精度。UCT 算法 [8] 是一种基于置信上限 (UCB) [2] 的树搜索方法,被认为能够局部适应树的有效平滑度。然而,我们表明 UCT 在某种意义上“过于乐观”,导致最坏情况下的遗憾可能非常糟糕。我们提出了替代的用于树搜索的 Bandit 算法。首先,分析了一种使用随视界深度指数缩放的置信序列的 UCT 修改版。接着,我们考虑了在叶子上执行的 Flat-UCB,并以高概率提供了有限遗憾界。然后,我们引入并分析了一种用于平滑树的 Bandit 算法 (BAST),该算法考虑了奖励的实际平滑度,从而以高置信度对次优分支进行有效的“剪枝”。最后,我们提出了一种增量树扩展方法,适用于完整树过大(可能是无限的)而无法完全表示的情况,并表明以高概率只有最优分支会被无限发展。我们在给定噪声值的连续函数全局优化问题上说明了这些方法。
引用
@article{arxiv.1408.2028,
title = {Bandit Algorithms for Tree Search},
author = {Pierre-Arnuad Coquelin and Remi Munos},
journal= {arXiv preprint arXiv:1408.2028},
year = {2014}
}
备注
Appears in Proceedings of the Twenty-Third Conference on Uncertainty in Artificial Intelligence (UAI2007)