中文

蒙特卡洛树搜索的非渐近分析

机器学习 2020-01-14 v4 机器学习

摘要

在这项工作中,我们在无限时域折扣代价马尔可夫决策过程(MDP)的框架下,考虑强化学习框架中流行的基于树的搜索策略——蒙特卡洛树搜索(MCTS)。尽管人们认为 MCTS 在足够多的模拟下能为给定状态提供近似价值函数,但开创性工作中所声称的证明是不完整的。这是因为先前工作中分析的变体——树的上置信界(UCT)——遵循随机多臂老虎机(MAB)文献的见解,在基于树的搜索中使用“对数”奖励项来平衡探索与利用。实际上,这种方法假设底层递归依赖的非平稳 MAB 的遗憾围绕其均值以步数指数方式集中,正如文献所指出的,即使对于平稳 MAB,这也不太可能成立。作为本工作的关键贡献,我们建立了一类非平稳 MAB 遗憾的多项式集中性质。这反过来确立了在 UCB 中使用适当的多项式而非对数奖励项的 MCTS 具有所声称的性质。以此为基石,我们论证 MCTS 结合最近邻监督学习充当“策略改进”算子:由于与监督学习相结合,尽管仅在有限多个状态上评估,它迭代地改进所有状态的价值函数近似。实际上,我们确立为了学习关于 \ell_\infty 范数的价值函数的 ε\varepsilon 近似,结合最近邻的 MCTS 所需的样本量缩放为 O~(ε(d+4))\widetilde{O}\big(\varepsilon^{-(d+4)}\big),其中 dd 是状态空间的维数。由于 Ω~(ε(d+2))\widetilde{\Omega}\big(\varepsilon^{-(d+2)}\big) 的极小极大下界,这几乎是最优的。

关键词

引用

@article{arxiv.1902.05213,
  title  = {Non-Asymptotic Analysis of Monte Carlo Tree Search},
  author = {Devavrat Shah and Qiaomin Xie and Zhi Xu},
  journal= {arXiv preprint arXiv:1902.05213},
  year   = {2020}
}