中文

学习未知马尔可夫决策过程:一种汤普森采样方法

机器学习 2017-09-15 v1

摘要

我们考虑在无限期设置中学习弱通信的未知马尔可夫决策过程(MDP)的问题。我们提出一种基于汤普森采样且具有动态片段的强化学习算法(TSDE)。在每一片段开始时,该算法从未知模型参数的后验分布中生成样本。然后,在该片段的剩余部分,它遵循针对采样模型的最优平稳策略。每个片段的持续时间由两个停止标准动态确定。第一个停止标准控制片段长度的增长率。第二个停止标准在任何状态-动作对被访问次数加倍时发生。我们在贝叶斯设置下建立了期望后悔的 O~(HSAT)\tilde O(HS\sqrt{AT}) 界,其中 SSAA 是状态和动作空间的大小,TT 是时间,HH 是跨度的界。该后悔界与弱通信 MDP 的最佳可用界相匹配。数值结果表明,其性能优于现有的无限期 MDP 算法。

关键词

引用

@article{arxiv.1709.04570,
  title  = {Learning Unknown Markov Decision Processes: A Thompson Sampling Approach},
  author = {Yi Ouyang and Mukul Gagrani and Ashutosh Nayyar and Rahul Jain},
  journal= {arXiv preprint arXiv:1709.04570},
  year   = {2017}
}

备注

Accepted to NIPS 2017