中文

带方差缩减的Greedy-GQ:有限时间分析与改进复杂度

机器学习 2021-03-31 v1 最优化与控制

摘要

Greedy-GQ是一种用于最优控制的基于值的强化学习(RL)算法。近来,Greedy-GQ的有限时间分析已在线性函数逼近与马尔可夫采样下得到发展,且该算法被证明能以O(ϵ3)\mathcal{O}(\epsilon^{-3})量级的样本复杂度达到一个ϵ\epsilon-平稳点。如此高的样本复杂度源于马尔可夫样本所引发的大方差。在本文中,我们提出一种用于离策略最优控制的方差缩减Greedy-GQ(VR-Greedy-GQ)算法。具体而言,该算法采用基于SVRG的方差缩减方案来降低双时间尺度更新的随机方差。我们在线性函数逼近与马尔可夫采样下研究了VR-Greedy-GQ的有限时间收敛性,并证明该算法比原始Greedy-GQ实现了更小的偏差与方差误差。特别地,我们证明VR-Greedy-GQ达到了改进的、处于O(ϵ2)\mathcal{O}(\epsilon^{-2})量级的样本复杂度。我们进一步在各种RL实验中将VR-Greedy-GQ与Greedy-GQ的性能进行比较,以佐证我们的理论发现。

关键词

引用

@article{arxiv.2103.16377,
  title  = {Greedy-GQ with Variance Reduction: Finite-time Analysis and Improved Complexity},
  author = {Shaocong Ma and Ziyi Chen and Yi Zhou and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2103.16377},
  year   = {2021}
}

备注

Accepted for publication in ICLR 2021