全动作策略梯度方法:一种数值积分视角
机器学习
2019-10-22 v1 人工智能
机器学习
摘要
尽管常被表述为似然比技巧[Rubinstein, 1989]的一个实例,原始的策略梯度定理[Sutton, 1999]涉及对动作空间的积分。当该积分可计算时,所得“全动作”估计量[Sutton, 2001]提供了一种条件作用效应[Bratley, 1987],与REINFORCE估计量[Williams, 1992]相比显著降低了方差。在本文中,我们采用数值积分视角,将全动作估计量的适用性扩展到一般空间以及策略或评论家组件的任意函数类,超越了[Ciosek, 2018]所考虑的高斯情形。此外,我们给出了关于使用有偏评论家所产生影响的新理论结果,该结果比[Sutton, 1999]先前提出的“兼容特征”条件提供了更多指导。我们在具有非线性函数逼近的连续控制任务中展示了我们方法的优势。我们的结果显示了性能和采样效率的提升。
引用
@article{arxiv.1910.09093,
title = {All-Action Policy Gradient Methods: A Numerical Integration Approach},
author = {Benjamin Petit and Loren Amdahl-Culleton and Yao Liu and Jimmy Smith and Pierre-Luc Bacon},
journal= {arXiv preprint arXiv:1910.09093},
year = {2019}
}
备注
9 pages, 2 figures. NeurIPS 2019 Optimization Foundations of Reinforcement Learning Workshop