中文

上下文决策过程中的基于模型强化学习:PAC界及相对于无模型方法的指数级改进

机器学习 2019-05-31 v3 机器学习

摘要

我们研究了在需要策略性探索以寻找近最优策略的一般上下文决策过程中,基于模型的强化学习(以下简称RL)的样本复杂度。我们为带有通用模型类的RL设计了新算法,并分析了它们的统计性质。我们的算法的样本复杂度由一个称为见证秩(witness rank)的新结构参数所支配,我们证明该参数在若干感兴趣的设置中(包括因子化MDP)较小。我们还表明,见证秩从不大于最近提出的、支配无模型算法OLIVE(Jiang et al., 2017)样本复杂度的Bellman秩参数,而OLIVE是在此通用性水平上唯一其他可证明样本高效的全局探索算法。聚焦于因子化MDP这一特例,我们证明了一类通用无模型方法(包括OLIVE)的指数级下界,结合我们的算法结果,这展示了在某些富观测设置中基于模型与无模型RL之间的指数级分离。

关键词

引用

@article{arxiv.1811.08540,
  title  = {Model-based RL in Contextual Decision Processes: PAC bounds and Exponential Improvements over Model-free Approaches},
  author = {Wen Sun and Nan Jiang and Akshay Krishnamurthy and Alekh Agarwal and John Langford},
  journal= {arXiv preprint arXiv:1811.08540},
  year   = {2019}
}

备注

COLT 2019