POLY-HOOT:连续空间 MDP 中带非渐近分析的蒙特卡洛规划
人工智能
2021-01-01 v2 机器学习
摘要
以蒙特卡洛树搜索(MCTS)为代表的蒙特卡洛规划在有限空间应用中展现了卓越性能。本文中,我们考虑在具连续状态-动作空间的环境中做蒙特卡洛规划,这是一个理解甚少但在控制与机器人中有重要应用的问题。我们引入 POLY-HOOT,一种用名为分层乐观优化(HOO)(Bubeck 等,2011)的连续臂赌博机策略增强 MCTS 的算法。具体地,我们通过在上置信界中使用适当的多项式而非对数奖励项来改进 HOO。此类多项式奖励项受其在 AlphaGo Zero(Silver 等,2017b)中经验成功的启发,并在实现有限空间 MCTS 的理论保证中发挥重要作用(Shah 等,2019)。我们首次研究了增强 HOO 算法在非平稳赌博机问题中的后悔值。将此结果作为基石,我们建立了 POLY-HOOT 的非渐近收敛保证:价值估计以多项式速率收敛到最优价值函数的任意小邻域。我们进一步提供了印证理论发现的实验结果。
引用
@article{arxiv.2006.04672,
title = {POLY-HOOT: Monte-Carlo Planning in Continuous Space MDPs with Non-Asymptotic Analysis},
author = {Weichao Mao and Kaiqing Zhang and Qiaomin Xie and Tamer Başar},
journal= {arXiv preprint arXiv:2006.04672},
year = {2021}
}
备注
NeurIPS 2020