带有采样信息松弛对偶界的蒙特卡洛树搜索
最优化与控制
2017-04-21 v1 人工智能
机器学习
摘要
蒙特卡洛树搜索(MCTS),最著名的应用是在博弈人工智能中(例如围棋),是构建序贯决策问题近似解的知名策略。其主要创新是使用一种称为默认策略(default policy)的启发式方法,来获得决策树中状态的下游值的蒙特卡洛估计。该信息被用于迭代地将树扩展向最优策略可能访问的状态和动作区域。然而,为保证收敛到最优动作,MCTS 要求渐近地扩展整棵树。本文提出一种称为原始-对偶 MCTS(Primal-Dual MCTS)的新技术,它利用对潜在动作的采样信息松弛上界,创造了“忽略”源自高度次优选择的分支的可能性。这使我们能够证明,尽管极限下收敛到部分决策树,Primal-Dual MCTS 推荐的动作是最优的。新方法在优化拼车平台上单个驾驶员在图中导航的行为时显示出重大前景。在新泽西州 7000 次行程的真实数据集上的数值实验表明,Primal-Dual MCTS 通过产生更深的决策树改进了标准 MCTS,并且对动作空间大小的敏感性降低。
引用
@article{arxiv.1704.05963,
title = {Monte Carlo Tree Search with Sampled Information Relaxation Dual Bounds},
author = {Daniel R. Jiang and Lina Al-Kanj and Warren B. Powell},
journal= {arXiv preprint arXiv:1704.05963},
year = {2017}
}
备注
33 pages, 6 figures