经典规划中探索与利用的尺度自适应平衡
人工智能
2026-03-30 v4
摘要
平衡探索与利用一直是博弈树搜索与自动规划中的重要问题。然而,尽管该问题在多臂老虎机(MAB)文献中已被广泛分析,规划界在尝试应用这些结果时成效有限。我们表明,对 MAB 文献更细致的理论理解有助于改进基于蒙特卡洛树搜索(MCTS)/基于试次的启发式树搜索(THTS)的现有规划算法。具体而言,THTS 以临时方式使用 UCB1 MAB 算法,因为 UCB1 对固定有界支撑奖励分布的理论要求无法满足于经典规划的启发式搜索中。核心问题在于 UCB1 未对奖励的不同尺度作出适应。我们提出 GreedyUCT-Normal,一种采用 UCB1-Normal 老虎机的 MCTS/THTS 算法,用于敏捷经典规划,其通过考虑奖励方差来处理不同尺度的分布,并带来改进算法性能(以更少节点扩展发现更多规划),优于贪心最佳优先搜索及现有基于 MCTS/THTS 的算法(GreedyUCT、GreedyUCT*)。
引用
@article{arxiv.2305.09840,
title = {Scale-Adaptive Balancing of Exploration and Exploitation in Classical Planning},
author = {Stephen Wissow and Masataro Asai},
journal= {arXiv preprint arXiv:2305.09840},
year = {2026}
}
备注
Outstanding paper award in ECAI 2024