带方差缩减的Greedy-GQ:有限时间分析与改进复杂度
机器学习
2021-03-31 v1 最优化与控制
摘要
Greedy-GQ是一种用于最优控制的基于值的强化学习(RL)算法。近来,Greedy-GQ的有限时间分析已在线性函数逼近与马尔可夫采样下得到发展,且该算法被证明能以量级的样本复杂度达到一个-平稳点。如此高的样本复杂度源于马尔可夫样本所引发的大方差。在本文中,我们提出一种用于离策略最优控制的方差缩减Greedy-GQ(VR-Greedy-GQ)算法。具体而言,该算法采用基于SVRG的方差缩减方案来降低双时间尺度更新的随机方差。我们在线性函数逼近与马尔可夫采样下研究了VR-Greedy-GQ的有限时间收敛性,并证明该算法比原始Greedy-GQ实现了更小的偏差与方差误差。特别地,我们证明VR-Greedy-GQ达到了改进的、处于量级的样本复杂度。我们进一步在各种RL实验中将VR-Greedy-GQ与Greedy-GQ的性能进行比较,以佐证我们的理论发现。
引用
@article{arxiv.2103.16377,
title = {Greedy-GQ with Variance Reduction: Finite-time Analysis and Improved Complexity},
author = {Shaocong Ma and Ziyi Chen and Yi Zhou and Shaofeng Zou},
journal= {arXiv preprint arXiv:2103.16377},
year = {2021}
}
备注
Accepted for publication in ICLR 2021