中文

经典规划中的极值蒙特卡罗树搜索

人工智能 2026-03-30 v3

摘要

尽管蒙特卡罗树搜索(MCTS)结合多臂老虎机(Multi Armed Bandits, MABs)在棋盘游戏和强化学习(RL)中取得成功,但在领域无关的经典规划中仅近期才取得有限成功。先前的工作(Wissow 和 Asai 2024)表明,针对有界奖励设计的 UCB1 在经典规划中应用于代价-到-终点估计时表现不佳,因为后者在 R\mathbb{R} 中是无界的,同时使用高斯奖励 MAB 可获得改进性能。本文进一步细化了针对规划任务的理想老虎机的理解。既有工作存在两个问题:首先,高斯 MAB 将成本-到-终点估计的支持范围规定为 (,)(-\infty,\infty),而我们可以将其缩小;其次,全Bellman备份(Schulte 和 Keller 2014)对样本最大/最小值进行反向传播,缺乏理论依据。我们采用“峰值-阈值极值理论”(Peaks-Over-Threashold Extreme Value Theory)一次性解决这两个问题,并提出一种新的老虎机算法(UCB1-Uniform)。我们形式地证明了其 regret bound,并在经典规划中实证地展示了其性能。

关键词

引用

@article{arxiv.2405.18248,
  title  = {Extreme Value Monte Carlo Tree Search for Classical Planning},
  author = {Masataro Asai and Stephen Wissow},
  journal= {arXiv preprint arXiv:2405.18248},
  year   = {2026}
}

备注

Accepted in AAAI-26. arXiv admin note: substantial text overlap with arXiv:2305.09840 (background section)