中文

带 UCB 探索的 Q-learning 在无限 horizon MDP 中具有样本高效性

机器学习 2019-09-30 v2 机器学习

摘要

强化学习中的一个基本问题是模型无关算法是否具有样本高效性。最近,Jin 等人提出一种带 UCB 探索策略的 Q-learning 算法,并证明其对于有限 horizon 情节式 MDP 具有近乎最优的 regret 界。本文中,我们将带 UCB 探索奖励的 Q-learning 适配于带折扣奖励的无限 horizon MDP,且\emph{不}访问生成模型。我们表明我们算法的\emph{探索样本复杂度}以 O~(SAϵ2(1γ)7)\tilde{O}({\frac{SA}{\epsilon^2(1-\gamma)^7}}) 为界。这改进了此前该设定下由 delayed Q-learning 取得的最佳已知结果 O~(SAϵ4(1γ)8)\tilde{O}({\frac{SA}{\epsilon^4(1-\gamma)^8}}),并且在 ϵ\epsilon 以及 SSAA 方面(除对数因子外)匹配下界。

关键词

引用

@article{arxiv.1901.09311,
  title  = {Q-learning with UCB Exploration is Sample Efficient for Infinite-Horizon MDP},
  author = {Kefan Dong and Yuanhao Wang and Xiaoyu Chen and Liwei Wang},
  journal= {arXiv preprint arXiv:1901.09311},
  year   = {2019}
}