带 UCB 探索的 Q-learning 在无限 horizon MDP 中具有样本高效性
机器学习
2019-09-30 v2 机器学习
摘要
强化学习中的一个基本问题是模型无关算法是否具有样本高效性。最近,Jin 等人提出一种带 UCB 探索策略的 Q-learning 算法,并证明其对于有限 horizon 情节式 MDP 具有近乎最优的 regret 界。本文中,我们将带 UCB 探索奖励的 Q-learning 适配于带折扣奖励的无限 horizon MDP,且\emph{不}访问生成模型。我们表明我们算法的\emph{探索样本复杂度}以 为界。这改进了此前该设定下由 delayed Q-learning 取得的最佳已知结果 ,并且在 以及 和 方面(除对数因子外)匹配下界。
引用
@article{arxiv.1901.09311,
title = {Q-learning with UCB Exploration is Sample Efficient for Infinite-Horizon MDP},
author = {Kefan Dong and Yuanhao Wang and Xiaoyu Chen and Liwei Wang},
journal= {arXiv preprint arXiv:1901.09311},
year = {2019}
}