中文

对(方差缩减)策略梯度与自然策略梯度方法的改进分析

机器学习 2022-11-17 v2

摘要

在本文中,我们在一般光滑策略参数化下重新审视并改进了策略梯度(PG)、自然策略梯度(NPG)方法及其方差缩减变体的收敛性。更具体地说,在策略的 Fisher 信息矩阵正定的条件下:i) 我们证明了一个最先进的方差缩减 PG 方法——该方法此前仅被证明收敛到驻点——能够收敛到全局最优值,直至由策略参数化引起的某些固有函数逼近误差;ii) 我们证明 NPG 具有更低的样本复杂度;iii) 我们提出了 SRVR-NPG,将方差缩减引入 NPG 更新中。我们的改进源于一个观察:即(方差缩减)PG 与 NPG 方法的收敛性能够相互改进:PG 的驻点收敛分析也可应用于 NPG,而 NPG 的全局收敛分析有助于建立(方差缩减)PG 方法的全局收敛。我们的分析细致地整合了这两类工作的优势。得益于这一改进,我们也使 NPG 的方差缩减成为可能,同时具备全局收敛性与高效的有限样本复杂度。

关键词

引用

@article{arxiv.2211.07937,
  title  = {An Improved Analysis of (Variance-Reduced) Policy Gradient and Natural Policy Gradient Methods},
  author = {Yanli Liu and Kaiqing Zhang and Tamer Başar and Wotao Yin},
  journal= {arXiv preprint arXiv:2211.07937},
  year   = {2022}
}

备注

NeurIPS 2020 (improve the proof of Lemma B.1 and Proposition G.1.)