中文

插件式求解器对基于特征的强化学习是否具有样本高效性?

机器学习 2020-10-20 v2

摘要

人们认为基于模型的方法是基于特征的强化学习(RL)降低样本复杂度的关键。然而,即便对于线性情形,对基于模型的 RL 的样本最优性的理解仍 largely 缺失。本工作考虑在仅能访问生成模型的条件下,在具有线性加性特征表示的马尔可夫决策过程(MDP)中寻找 ϵ\epsilon-最优策略的样本复杂度。我们通过插件式求解器方法解决该问题,该方法构建一个经验模型并通过任意插件式求解器在该经验模型中规划。我们证明在锚状态(anchor-state)假设下——其意味着特征空间中的隐式非负性——在 γ\gamma-折扣 MDP 中寻找 ϵ\epsilon-最优策略的极小极大样本复杂度为 O(K/(1γ)3ϵ2)O(K/(1-\gamma)^3\epsilon^2),其仅依赖于特征空间的维数 KK,而与状态或动作空间无关。我们进一步将结果推广到锚状态可能不存在的宽松设定,并表明插件式方法同样可以具有样本高效性,为设计基于模型的 RL 算法提供了灵活途径。

关键词

引用

@article{arxiv.2010.05673,
  title  = {Is Plug-in Solver Sample-Efficient for Feature-based Reinforcement Learning?},
  author = {Qiwen Cui and Lin F. Yang},
  journal= {arXiv preprint arXiv:2010.05673},
  year   = {2020}
}

备注

30 pages, to appear in NeurIPS2020