中文

基于生成模型的模型强化学习达到极小极大最优

机器学习 2020-04-07 v3 概率论 机器学习

摘要

本文研究了在仅能访问生成模型的情况下,在折扣马尔可夫决策过程(MDP)中获得 ϵ\epsilon-最优策略的样本复杂度和计算复杂度。本文中,我们研究最自然的基于模型规划的插入式方法的有效性:我们从观测中构建 MDP 中转移模型的最大似然估计,然后在该经验 MDP 中寻找最优策略。我们提出 arguably 基于模型规划中最基本且未解决的问题:在给定固定样本量的情况下,朴素的“插入式”方法在非渐近意义下,在其所找到策略的质量上是否达到极小极大最优?这里,非渐近情形指的是样本量相对于模型规模为次线性。借助生成模型,我们以最强可能意义解决了该问题:我们的主要结果表明,用 NN 个样本构建的插入式模型中\emph{任何}高精度解,都在真实底层 MDP 中给出一个 ϵ\epsilon-最优策略(其中 ϵ\epsilon 是在每个状态-动作对上以 NN 个样本达到的极小极大精度)。相比之下,所有先前的(非渐近)极小极大最优结果都使用无模型方法,例如方差缩减 Q 值迭代算法(Sidford 等 2018),而已知最佳的基于模型的结果(如 Azar 等 2013)在其对规划时域或状态空间的依赖上需要更大的样本量。值得注意的是,我们表明基于模型的方法允许在经验 MDP 中使用\emph{任何}高效规划算法,这简化了算法设计,因为该方法不将算法与采样过程绑定。我们分析的核心是一种新颖的“吸收 MDP”构造,用于处理基于模型规划方法分析中出现的统计依赖问题,该构造可能具有更普遍的帮助。

关键词

引用

@article{arxiv.1906.03804,
  title  = {Model-Based Reinforcement Learning with a Generative Model is Minimax Optimal},
  author = {Alekh Agarwal and Sham Kakade and Lin F. Yang},
  journal= {arXiv preprint arXiv:1906.03804},
  year   = {2020}
}