基于非参数离屏策略策略梯度的批量强化学习
机器学习
2021-06-09 v3 人工智能
摘要
离屏策略强化学习(RL)有望获得更好的数据效率,因为它允许样本复用并潜在地实现与环境的安全交互。当前的离屏策略策略梯度方法要么偏差高,要么方差高,通常给出不可靠的估计。在低效率的代价在现实场景(如交互驱动的机器人学习)中变得明显,其中 RL 的成功相当有限,且极高的样本成本阻碍了直接应用。在本文中,我们提出一个非参数 Bellman 方程,它可闭式求解。该解对策略参数可微,并给出策略梯度的估计。以此方式,我们避免了重要性采样方法的高方差和半梯度方法的高偏差。我们实证分析了我们的梯度估计相对于最先进方法的质量,并表明在经典控制任务上它在样本效率方面优于基线。
引用
@article{arxiv.2010.14771,
title = {Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient},
author = {Samuele Tosatto and João Carvalho and Jan Peters},
journal= {arXiv preprint arXiv:2010.14771},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2001.02435