中文

PAGE-PG:一种基于概率梯度估计的简单无循环方差缩减策略梯度方法

机器学习 2022-02-02 v1 最优化与控制

摘要

尽管取得了成功,策略梯度方法仍受困于梯度估计的高方差,这可能导致不理想的样本复杂度。近来,人们提出了众多具有可证明更优样本复杂度和具竞争力数值表现的方差缩减策略梯度扩展方法。在简要综述若干主要方差缩减 REINFORCE 类方法后,我们提出 PAGE-PG(ProbAbilistic Gradient Estimation for Policy Gradient,策略梯度的概率梯度估计),一种新颖的基于两类更新间概率切换的无循环方差缩减策略梯度方法。我们的方法受监督学习中 PAGE 估计量启发,并利用重要性采样获得无偏梯度估计量。我们证明 PAGE-PG 达到 ϵ\epsilon-平稳解的平均样本复杂度为 O(ϵ3)\mathcal{O}\left( \epsilon^{-3} \right),这与同设定下最具竞争力的对应方法样本复杂度一致。数值评估证实了我们的方法在经典控制任务上的竞争力。

关键词

引用

@article{arxiv.2202.00308,
  title  = {PAGE-PG: A Simple and Loopless Variance-Reduced Policy Gradient Method with Probabilistic Gradient Estimation},
  author = {Matilde Gargiani and Andrea Zanelli and Andrea Martinelli and Tyler Summers and John Lygeros},
  journal= {arXiv preprint arXiv:2202.00308},
  year   = {2022}
}