贝叶斯优化的蒙特卡洛规划
人工智能
2021-11-04 v1
摘要
部分可观测马尔可夫决策过程的在线求解器难以扩展到具有大型动作空间的问题。采用渐进扩展的蒙特卡洛树搜索试图通过对动作空间进行采样来构建策略搜索树,从而改善扩展性。渐进扩展搜索的性能依赖于动作采样策略,通常需要针对特定问题的采样器。在本工作中,我们提出一种基于贝叶斯优化的高效动作采样通用方法。所提方法使用高斯过程对动作值函数上的置信进行建模,并选择能最大化最优动作值期望改进的 action。我们在一种称为贝叶斯优化的蒙特卡洛规划(BOMCP)的新型在线树搜索算法中实现了所提方法。若干实验表明,与现有最先进的树搜索求解器相比,BOMCP 更能扩展到大型动作空间 POMDP。
引用
@article{arxiv.2010.03597,
title = {Bayesian Optimized Monte Carlo Planning},
author = {John Mern and Anil Yildiz and Zachary Sunberg and Tapan Mukerji and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2010.03597},
year = {2021}
}
备注
8 pages