中文

方差一致有界的 Q-learning:大折扣因子并非快速学习的障碍

机器学习 2020-07-09 v2 系统与控制 系统与控制 机器学习

摘要

样本复杂度界是强化学习文献中一种常见的性能度量。在折扣代价、无限时域设定下,所有已知的界都含有一个关于 1/(1γ)1/(1-\gamma) 的多项式因子,其中 γ<1\gamma < 1 为折扣因子。对于较大的折扣因子,这些界似乎意味着需要极大量的样本才能达到 ε\varepsilon-最优策略。本文的目标是引入一类新算法,其样本复杂度对所有 γ<1\gamma < 1 一致有界。鉴于近期的一个极小极大下界,有人或许会认为这是不可能的。其解释是,该先前的下界针对的是一个特定问题,我们在不损害获得 ε\varepsilon-最优策略这一最终目标的前提下对其作了修改。具体而言,我们证明了采用优化步长序列的 Q-learning 算法的渐近协方差是 1/(1γ)1/(1-\gamma) 的二次函数;这是一个预期之中且基本已知的结果。本文提出的新型相对 Q-learning 算法被证明具有关于 1/(1ργ)1/(1- \rho^* \gamma) 的二次渐近协方差,其中 1ρ>01 - \rho^* > 0 是最优转移矩阵谱间隙的一个上界。

关键词

引用

@article{arxiv.2002.10301,
  title  = {Q-learning with Uniformly Bounded Variance: Large Discounting is Not a Barrier to Fast Learning},
  author = {Adithya M. Devraj and Sean P. Meyn},
  journal= {arXiv preprint arXiv:2002.10301},
  year   = {2020}
}

备注

33 pages, 4 figures