Loaded DiCE:在强化学习任意阶得分函数估计器中权衡偏差与方差
机器学习
2019-09-25 v1 机器学习
摘要
在动态未知或难以处理的随机环境中,基于梯度的目标优化方法需要导数估计器。我们推导了一个目标函数,在自动微分下能够产生任意阶导数的低方差无偏估计器。我们的目标函数与任意优势估计器兼容,从而在使用函数逼近时能够控制任意阶导数中的偏差与方差。此外,我们提出了一种方法,通过对更远距离的因果依赖影响进行折扣,来权衡高阶导数的偏差与方差。我们在解析可处理的 MDP 以及用于连续控制的元强化学习中证明了我们目标函数的正确性与实用性。
引用
@article{arxiv.1909.10549,
title = {Loaded DiCE: Trading off Bias and Variance in Any-Order Score Function Estimators for Reinforcement Learning},
author = {Gregory Farquhar and Shimon Whiteson and Jakob Foerster},
journal= {arXiv preprint arXiv:1909.10549},
year = {2019}
}