优于UCT:树中的理性蒙特卡洛采样
人工智能
2012-07-26 v2
摘要
UCT是蒙特卡洛树采样(MCTS)的一种先进算法,它基于UCB,后者是多臂老虎机问题(MAB)的一种采样策略,旨在最小化累积遗憾。然而,MCTS与MAB的不同之处在于,只有最终选择而非所有摇臂操作才会带来奖励,也就是说,必须最小化的是简单遗憾,而非累积遗憾。这项正在进行的工作旨在将元推理技术应用于MCTS,这并非易事。我们首先引入了具有比UCB更低简单遗憾的多臂老虎机策略,以及一种结合了累积和简单遗憾最小化并优于UCT的MCTS算法。我们还开发了一种松散地基于完美信息价值的短视版本的采样方案。本文提供了这些策略的有限时间与渐近分析,并对算法进行了经验比较。
引用
@article{arxiv.1108.3711,
title = {Doing Better Than UCT: Rational Monte Carlo Sampling in Trees},
author = {David Tolpin and Solomon Eyal Shimony},
journal= {arXiv preprint arXiv:1108.3711},
year = {2012}
}
备注
Withdrawn: "MCTS Based on Simple Regret" (arXiv:1207.5589) is the final corrected version published in AAAI 2012 proceedings