基于优化后验策略的蒙特卡罗树搜索加速
人工智能
2026-01-12 v2 机器学习
摘要
我们引入一种递归AlphaZero式蒙特卡罗树搜索算法"RMCTS"。RMCTS相对于AlphaZero的MCTS-UCB具有速度优势。在RMCTS中,搜索树以广度优先方式进行探索,以便网络推理自然发生在大批量中。这显著降低了GPU延迟成本。我们发现,针对单个根状态进行搜索时,RMCTS通常比MCTS-UCB快40倍以上,对大批量根状态进行搜索时快约3倍。RMCTS的递归基于在搜索树中的每个游戏状态处计算优化后的后验策略,从叶子向根工作。我们采用"蒙特卡罗树搜索作为正则化策略优化"(Grill等)中探索的后验策略。该后验策略是最大化给定估计动作奖励减去偏离先验策略惩罚的唯一策略。在RMCTS中探索的树不是以自适应方式定义的,相反,RMCTS树通过在每个节点处遵循先验网络策略来定义。这是一个缺点,但加速优势更为显著,我们实际发现RMCTS训练的网络在大约三分之一的训练时间内匹配MCTS-UCB训练的网络质量。我们对RMCTS与MCTS-UCB的计时和质量比较,针对三种游戏:Connect-4、Dots-and-Boxes和Othello。
引用
@article{arxiv.2601.01301,
title = {Accelerating Monte-Carlo Tree Search with Optimized Posterior Policies},
author = {Keith Frankston and Benjamin Howard},
journal= {arXiv preprint arXiv:2601.01301},
year = {2026}
}
备注
11 pages; an efficient implementation is available at https://github.com/bhoward73/rmcts