中文

关于 MCTS 在马尔可夫决策过程最优值估计中的收敛速率

最优化与控制 2025-02-04 v2

摘要

对一种从“应用于树的置信上限”(UCT) 算法适当修改而来的 Monte-Carlo 树搜索 (MCTS) 方法的近期理论分析,确立了一个令人惊讶的结果:在有限时域马尔可夫决策过程 (MDP) 中估计初始状态的最优值时,其期望绝对误差收敛到零的速率为 O(1/n)O(1/\sqrt{n}),其中 nn 为模拟次数。这一结果之所以令人惊讶,是因为文献中已有大量关于 UCT 在各种问题领域中进行启发式应用并作相关调整后取得成功的经验报道。我们通过在 MDP 的视角下,在一个更简单的算法框架内进行论证,加强了这一令人沮丧的慢收敛结果:将多臂老虎机问题的“置信上限 1”(UCB1) 这种更简单的策略作为 MCTS 的一个实例,通过将 UCB1 的臂集合设为底层 MDP 的策略集合,其具有 O(lnn/n)O(\ln n / n) 的渐近更快的收敛速率。我们还指出,基于 UCT 的 MCTS 在最坏情况下的时间和空间复杂度通常取决于状态空间的大小,这与 MCTS 的最初设计精神相矛盾。除非采用启发式方式使用,基于 UCT 的 MCTS 在其适用性方面尚缺乏理论支持。

关键词

引用

@article{arxiv.2402.07063,
  title  = {On the Convergence Rate of MCTS for the Optimal Value Estimation in Markov Decision Processes},
  author = {Hyeong Soo Chang},
  journal= {arXiv preprint arXiv:2402.07063},
  year   = {2025}
}