策略梯度中测度值导数的分析
机器学习
2022-03-09 v1
摘要
由于更好的策略梯度技术的不断发展,用于机器人学的强化学习方法日益成功。一个精确(低方差)且准确(低偏差)的梯度估计器对于应对日益复杂的任务至关重要。传统的策略梯度算法使用似然比技巧,已知其产生无偏但高方差的估计。更现代的方法利用重参数化技巧,其给出更低方差的梯度估计,但需要可微分的值函数近似器。在这项工作中,我们研究了一种不同类型的随机梯度估计器——测度值导数(Measure-Valued Derivative)。该估计器是无偏的、具有低方差,并且可与可微分和不可微分的函数近似器一起使用。我们在 actor-critic 策略梯度设置中对该估计器进行了实证评估,并表明无论是在低维还是高维动作空间中,它都能达到与基于似然比或重参数化技巧的方法相当的性能。通过这项工作,我们想表明测度值导数估计器可以成为其他策略梯度估计器的一个有用替代方案。
引用
@article{arxiv.2203.03917,
title = {An Analysis of Measure-Valued Derivatives for Policy Gradients},
author = {Joao Carvalho and Jan Peters},
journal= {arXiv preprint arXiv:2203.03917},
year = {2022}
}