学习未知马尔可夫决策过程:一种汤普森采样方法
机器学习
2017-09-15 v1
摘要
我们考虑在无限期设置中学习弱通信的未知马尔可夫决策过程(MDP)的问题。我们提出一种基于汤普森采样且具有动态片段的强化学习算法(TSDE)。在每一片段开始时,该算法从未知模型参数的后验分布中生成样本。然后,在该片段的剩余部分,它遵循针对采样模型的最优平稳策略。每个片段的持续时间由两个停止标准动态确定。第一个停止标准控制片段长度的增长率。第二个停止标准在任何状态-动作对被访问次数加倍时发生。我们在贝叶斯设置下建立了期望后悔的 界,其中 和 是状态和动作空间的大小, 是时间, 是跨度的界。该后悔界与弱通信 MDP 的最佳可用界相匹配。数值结果表明,其性能优于现有的无限期 MDP 算法。
引用
@article{arxiv.1709.04570,
title = {Learning Unknown Markov Decision Processes: A Thompson Sampling Approach},
author = {Yi Ouyang and Mukul Gagrani and Ashutosh Nayyar and Rahul Jain},
journal= {arXiv preprint arXiv:1709.04570},
year = {2017}
}
备注
Accepted to NIPS 2017