经典规划中的极值蒙特卡罗树搜索
人工智能
2026-03-30 v3
摘要
尽管蒙特卡罗树搜索(MCTS)结合多臂老虎机(Multi Armed Bandits, MABs)在棋盘游戏和强化学习(RL)中取得成功,但在领域无关的经典规划中仅近期才取得有限成功。先前的工作(Wissow 和 Asai 2024)表明,针对有界奖励设计的 UCB1 在经典规划中应用于代价-到-终点估计时表现不佳,因为后者在 中是无界的,同时使用高斯奖励 MAB 可获得改进性能。本文进一步细化了针对规划任务的理想老虎机的理解。既有工作存在两个问题:首先,高斯 MAB 将成本-到-终点估计的支持范围规定为 ,而我们可以将其缩小;其次,全Bellman备份(Schulte 和 Keller 2014)对样本最大/最小值进行反向传播,缺乏理论依据。我们采用“峰值-阈值极值理论”(Peaks-Over-Threashold Extreme Value Theory)一次性解决这两个问题,并提出一种新的老虎机算法(UCB1-Uniform)。我们形式地证明了其 regret bound,并在经典规划中实证地展示了其性能。
关键词
引用
@article{arxiv.2405.18248,
title = {Extreme Value Monte Carlo Tree Search for Classical Planning},
author = {Masataro Asai and Stephen Wissow},
journal= {arXiv preprint arXiv:2405.18248},
year = {2026}
}
备注
Accepted in AAAI-26. arXiv admin note: substantial text overlap with arXiv:2305.09840 (background section)