计算选择:理论与应用
人工智能
2014-08-12 v1
摘要
序列决策问题通常可以通过模拟可能的未来动作序列来近似求解。元层级(Metalevel)决策程序已被开发用于选择要模拟的动作序列,其依据是估计任何特定模拟所能带来的决策质量预期提升;一个例子是近期利用多臂老虎机算法控制围棋中蒙特卡洛树搜索的工作。在本文中,我们在贝叶斯选择问题的统计框架下为元层级决策建立了理论基础,并论证(正如其他人所做的那样)该框架比多臂老虎机框架更为合适。我们推导出了若干适用于蒙特卡洛选择问题的基本结果,包括某些情况下最优策略的首个有限采样界;我们还提供了一个简单的反例,驳斥了“最优策略在所有情况下必然能达成决策”这一直觉猜想。随后,我们在贝叶斯和无分布(distribution-free)设定下推导了启发式近似方法,并证明了它们在单次决策问题和围棋中优于基于多臂老虎机的启发式方法。
引用
@article{arxiv.1408.2048,
title = {Selecting Computations: Theory and Applications},
author = {Nicholas Hay and Stuart Russell and David Tolpin and Solomon Eyal Shimony},
journal= {arXiv preprint arXiv:1408.2048},
year = {2014}
}
备注
Appears in Proceedings of the Twenty-Eighth Conference on Uncertainty in Artificial Intelligence (UAI2012)