中文

Bayes-CPACE:连续空间贝叶斯自适应马尔可夫决策过程中的 PAC 最优探索

机器学习 2018-10-09 v1 机器人学 机器学习

摘要

据我们所知,我们提出了首个针对连续状态与动作空间中贝叶斯自适应马尔可夫决策过程(BAMDPs)的 PAC 最优算法。BAMDP 框架通过将贝叶斯信念更新纳入长期期望回报,优雅地解决了模型不确定性问题。然而,计算精确的贝叶斯最优策略是难解的。我们的关键见解是通过用有限组代表性样本覆盖连续状态-信念-动作空间,并利用值函数的 Lipschitz 连续性,来计算近最优值函数。我们证明了算法的近最优性,并分析了一些提升算法效率的方案。最后,我们在多个离散与连续 BAMDPs 上实证验证了我们的方法,并显示所学策略相对于基线方法具有持续有竞争力的性能。

关键词

引用

@article{arxiv.1810.03048,
  title  = {Bayes-CPACE: PAC Optimal Exploration in Continuous Space Bayes-Adaptive Markov Decision Processes},
  author = {Gilwoo Lee and Sanjiban Choudhury and Brian Hou and Siddhartha S. Srinivasa},
  journal= {arXiv preprint arXiv:1810.03048},
  year   = {2018}
}