策略梯度中测度值导数的实证分析
机器学习
2021-07-21 v1 人工智能
摘要
由于更好的策略梯度技术的不断发展,用于机器人学的强化学习方法日益成功。精确(低方差)且准确(低偏差)的梯度估计器对于应对日益复杂的任务至关重要。传统的策略梯度算法使用似然比技巧,已知其产生无偏但高方差的估计。更现代的方法利用重参数化技巧,其给出更低方差的梯度估计,但要求可微分的值函数近似器。在本工作中,我们研究一种不同类型的随机梯度估计器:测度值导数(Measure-Valued Derivative)。该估计器无偏、低方差,并且可与可微分和不可微分的函数近似器一起使用。我们在 actor-critic 策略梯度设定下对该估计器进行实证评估,并表明其在低维和高维动作空间中均可达到与基于似然比或重参数化技巧的方法相当的性能。
引用
@article{arxiv.2107.09359,
title = {An Empirical Analysis of Measure-Valued Derivatives for Policy Gradients},
author = {João Carvalho and Davide Tateo and Fabio Muratore and Jan Peters},
journal= {arXiv preprint arXiv:2107.09359},
year = {2021}
}