中文

方差缩减Q学习是极小极大的最优方法

机器学习 2019-08-09 v2 最优化与控制 机器学习

摘要

我们引入并分析了一种方差缩减Q学习形式。对于具有有限状态空间X\mathcal{X}和动作空间U\mathcal{U}γ\gamma-折扣MDP,我们证明其在\ell_\infty-范数下使用O((Dϵ2(1γ)3)  log(D(1γ)))\mathcal{O} \left(\left(\frac{D}{ \epsilon^2 (1-\gamma)^3} \right) \; \log \left( \frac{D}{(1-\gamma)} \right) \right)个样本即可产生最优QQ-函数的ϵ\epsilon-精度估计,其中D=X×UD = |\mathcal{X}| \times |\mathcal{U}|。该保证与已知的极小极大下界在折扣复杂度的对数因子内相匹配。相比之下,我们以往的工作表明普通QQ-学习在最坏情况下对折扣复杂度具有四次标度。

关键词

引用

@article{arxiv.1906.04697,
  title  = {Variance-reduced $Q$-learning is minimax optimal},
  author = {Martin J. Wainwright},
  journal= {arXiv preprint arXiv:1906.04697},
  year   = {2019}
}

备注

Update from v1: new Proposition 1 on minimax optimality; updated referencing and discussion of related work