一种非参数离屏策略策略梯度
机器学习
2020-08-04 v3 机器学习
摘要
尽管近期取得卓越成功,强化学习(RL)算法仍受高样本复杂度的困扰。在许多广泛流行的使用 on-policy 样本进行更新的策略梯度算法中,尤其观察到需要与环境的密集交互。这种低效的代价在现实场景(如交互驱动的机器人学习)中显而易见,RL 在这些场景中的成功相当有限。我们通过构建于离屏(off-policy)算法的一般样本效率之上来解决此问题。利用非参数回归与密度估计方法,我们以原则性方式构造非参数 Bellman 方程,从而能够获得值函数的闭式估计,并解析表达完整的策略梯度。我们对该估计提供理论分析,表明其在温和光滑性假设下是一致的,并通过实证显示我们的方法比最先进的策略梯度方法具有更好的样本效率。
引用
@article{arxiv.2001.02435,
title = {A Nonparametric Off-Policy Policy Gradient},
author = {Samuele Tosatto and Joao Carvalho and Hany Abdulsamad and Jan Peters},
journal= {arXiv preprint arXiv:2001.02435},
year = {2020}
}