蒙特卡洛树搜索的非渐近分析
机器学习
2020-01-14 v4 机器学习
摘要
在这项工作中,我们在无限时域折扣代价马尔可夫决策过程(MDP)的框架下,考虑强化学习框架中流行的基于树的搜索策略——蒙特卡洛树搜索(MCTS)。尽管人们认为 MCTS 在足够多的模拟下能为给定状态提供近似价值函数,但开创性工作中所声称的证明是不完整的。这是因为先前工作中分析的变体——树的上置信界(UCT)——遵循随机多臂老虎机(MAB)文献的见解,在基于树的搜索中使用“对数”奖励项来平衡探索与利用。实际上,这种方法假设底层递归依赖的非平稳 MAB 的遗憾围绕其均值以步数指数方式集中,正如文献所指出的,即使对于平稳 MAB,这也不太可能成立。作为本工作的关键贡献,我们建立了一类非平稳 MAB 遗憾的多项式集中性质。这反过来确立了在 UCB 中使用适当的多项式而非对数奖励项的 MCTS 具有所声称的性质。以此为基石,我们论证 MCTS 结合最近邻监督学习充当“策略改进”算子:由于与监督学习相结合,尽管仅在有限多个状态上评估,它迭代地改进所有状态的价值函数近似。实际上,我们确立为了学习关于 范数的价值函数的 近似,结合最近邻的 MCTS 所需的样本量缩放为 ,其中 是状态空间的维数。由于 的极小极大下界,这几乎是最优的。
引用
@article{arxiv.1902.05213,
title = {Non-Asymptotic Analysis of Monte Carlo Tree Search},
author = {Devavrat Shah and Qiaomin Xie and Zhi Xu},
journal= {arXiv preprint arXiv:1902.05213},
year = {2020}
}