基于最近邻的 Q-learning
机器学习
2018-10-24 v2 最优化与控制
机器学习
摘要
我们考虑无限 horizon 折扣马尔可夫决策过程(MDPs)的无模型强化学习,其具有连续状态空间和未知转移核,且仅有系统在任意策略下的单条样本路径可用。我们考虑最近邻 Q-learning(NNQL)算法,使用最近邻回归方法学习最优 Q 函数。作为主要贡献,我们给出了收敛速率的紧有限样本分析。特别地,对于具有 维状态空间和折扣因子 的 MDP,给定一条具有“覆盖时间” 的任意样本路径,我们确立该算法保证使用 个样本输出最优 Q 函数的 精度估计。例如,对于行为良好的 MDP,纯随机策略下样本路径的覆盖时间随 缩放,因此样本复杂度随 缩放。实际上,我们确立了一个下界,论证了 的依赖是必要的。
引用
@article{arxiv.1802.03900,
title = {Q-learning with Nearest Neighbors},
author = {Devavrat Shah and Qiaomin Xie},
journal= {arXiv preprint arXiv:1802.03900},
year = {2018}
}
备注
Accepted to NIPS 2018