方差缩减Q学习是极小极大的最优方法
机器学习
2019-08-09 v2 最优化与控制
机器学习
摘要
我们引入并分析了一种方差缩减Q学习形式。对于具有有限状态空间和动作空间的-折扣MDP,我们证明其在-范数下使用个样本即可产生最优-函数的-精度估计,其中。该保证与已知的极小极大下界在折扣复杂度的对数因子内相匹配。相比之下,我们以往的工作表明普通-学习在最坏情况下对折扣复杂度具有四次标度。
引用
@article{arxiv.1906.04697,
title = {Variance-reduced $Q$-learning is minimax optimal},
author = {Martin J. Wainwright},
journal= {arXiv preprint arXiv:1906.04697},
year = {2019}
}
备注
Update from v1: new Proposition 1 on minimax optimality; updated referencing and discussion of related work