中文

基于最近邻的极小极大最优Q学习

机器学习 2024-06-18 v2 机器学习

摘要

分析具有连续状态空间的马尔可夫决策过程(MDP)通常具有挑战性。最近一项有趣的工作\cite{shah2018q}通过最近邻QQ学习方法求解有界连续状态空间MDP,在折扣因子γ\gamma下对ϵ\epsilon精度的QQ函数估计具有O~(1ϵd+3(1γ)d+7)\tilde{O}(\frac{1}{\epsilon^{d+3}(1-\gamma)^{d+7}})的样本复杂度。本文提出两种新的最近邻QQ学习方法,一种用于离线设置,另一种用于在线设置。我们证明这两种方法的样本复杂度分别为O~(1ϵd+2(1γ)d+2)\tilde{O}(\frac{1}{\epsilon^{d+2}(1-\gamma)^{d+2}})(离线)与O~(1ϵd+2(1γ)d+3)\tilde{O}(\frac{1}{\epsilon^{d+2}(1-\gamma)^{d+3}})(在线),较现有结果显著提升,且对ϵ\epsilon具有极小极大最优依赖。我们通过更高效地利用样本实现此种改进。具体而言,\cite{shah2018q}中的方法在每次迭代后清除所有样本,因而这些样本某种程度上被浪费。相反,我们的离线方法不移除任何样本,而在线方法仅在时刻tt移除早于βt\beta t的样本,其中β\beta为可调参数,故我们的方法显著减少了信息损失。除样本复杂度外,我们的方法还具有计算复杂度更优以及适用于无界状态空间等额外优势。

关键词

引用

@article{arxiv.2308.01490,
  title  = {Minimax Optimal Q Learning with Nearest Neighbors},
  author = {Puning Zhao and Lifeng Lai},
  journal= {arXiv preprint arXiv:2308.01490},
  year   = {2024}
}