中文

理解自然策略梯度强化学习中二阶近似的影响

机器学习 2022-10-12 v2

摘要

自然策略梯度方法是流行的强化学习方法,通过利用二阶近似以 Fisher 信息矩阵的逆对梯度进行预处理,从而提高了策略梯度方法的稳定性。然而,据作者所知,尚未有研究以全面且系统的方式考察不同二阶近似的影响。为此,本研究考察并比较了五种不同的二阶近似在多个关键指标上的表现,包括性能、稳定性、样本效率和计算时间。此外,还研究了文献中通常未被关注的超参数,包括不同批量大小的影响以及使用自然梯度优化评论家网络。实验结果表明,平均而言,改进的二阶近似取得了最佳性能,且使用经过适当调优的超参数可带来性能和样本效率的大幅提升,最高达 +181%。我们还在 https://github.com/gebob19/natural-policy-gradient-reinforcement-learning 公开了本研究代码。

关键词

引用

@article{arxiv.2201.09104,
  title  = {Understanding the Effects of Second-Order Approximations in Natural Policy Gradient Reinforcement Learning},
  author = {Brennan Gebotys and Alexander Wong and David A. Clausi},
  journal= {arXiv preprint arXiv:2201.09104},
  year   = {2022}
}