方差一致有界的 Q-learning:大折扣因子并非快速学习的障碍
机器学习
2020-07-09 v2 系统与控制
系统与控制
机器学习
摘要
样本复杂度界是强化学习文献中一种常见的性能度量。在折扣代价、无限时域设定下,所有已知的界都含有一个关于 的多项式因子,其中 为折扣因子。对于较大的折扣因子,这些界似乎意味着需要极大量的样本才能达到 -最优策略。本文的目标是引入一类新算法,其样本复杂度对所有 一致有界。鉴于近期的一个极小极大下界,有人或许会认为这是不可能的。其解释是,该先前的下界针对的是一个特定问题,我们在不损害获得 -最优策略这一最终目标的前提下对其作了修改。具体而言,我们证明了采用优化步长序列的 Q-learning 算法的渐近协方差是 的二次函数;这是一个预期之中且基本已知的结果。本文提出的新型相对 Q-learning 算法被证明具有关于 的二次渐近协方差,其中 是最优转移矩阵谱间隙的一个上界。
引用
@article{arxiv.2002.10301,
title = {Q-learning with Uniformly Bounded Variance: Large Discounting is Not a Barrier to Fast Learning},
author = {Adithya M. Devraj and Sean P. Meyn},
journal= {arXiv preprint arXiv:2002.10301},
year = {2020}
}
备注
33 pages, 4 figures