中文

基于最近邻的 Q-learning

机器学习 2018-10-24 v2 最优化与控制 机器学习

摘要

我们考虑无限 horizon 折扣马尔可夫决策过程(MDPs)的无模型强化学习,其具有连续状态空间和未知转移核,且仅有系统在任意策略下的单条样本路径可用。我们考虑最近邻 Q-learning(NNQL)算法,使用最近邻回归方法学习最优 Q 函数。作为主要贡献,我们给出了收敛速率的紧有限样本分析。特别地,对于具有 dd 维状态空间和折扣因子 γ(0,1)\gamma \in (0,1) 的 MDP,给定一条具有“覆盖时间” L L 的任意样本路径,我们确立该算法保证使用 O~(L/(ε3(1γ)7))\tilde{O}\big(L/(\varepsilon^3(1-\gamma)^7)\big) 个样本输出最优 Q 函数的 ε\varepsilon 精度估计。例如,对于行为良好的 MDP,纯随机策略下样本路径的覆盖时间随 O~(1/εd) \tilde{O}\big(1/\varepsilon^d\big) 缩放,因此样本复杂度随 O~(1/εd+3)\tilde{O}\big(1/\varepsilon^{d+3}\big) 缩放。实际上,我们确立了一个下界,论证了 Ω~(1/εd+2) \tilde{\Omega}\big(1/\varepsilon^{d+2}\big) 的依赖是必要的。

关键词

引用

@article{arxiv.1802.03900,
  title  = {Q-learning with Nearest Neighbors},
  author = {Devavrat Shah and Qiaomin Xie},
  journal= {arXiv preprint arXiv:1802.03900},
  year   = {2018}
}

备注

Accepted to NIPS 2018