中文

基于非参数离屏策略策略梯度的批量强化学习

机器学习 2021-06-09 v3 人工智能

摘要

离屏策略强化学习(RL)有望获得更好的数据效率,因为它允许样本复用并潜在地实现与环境的安全交互。当前的离屏策略策略梯度方法要么偏差高,要么方差高,通常给出不可靠的估计。在低效率的代价在现实场景(如交互驱动的机器人学习)中变得明显,其中 RL 的成功相当有限,且极高的样本成本阻碍了直接应用。在本文中,我们提出一个非参数 Bellman 方程,它可闭式求解。该解对策略参数可微,并给出策略梯度的估计。以此方式,我们避免了重要性采样方法的高方差和半梯度方法的高偏差。我们实证分析了我们的梯度估计相对于最先进方法的质量,并表明在经典控制任务上它在样本效率方面优于基线。

关键词

引用

@article{arxiv.2010.14771,
  title  = {Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient},
  author = {Samuele Tosatto and João Carvalho and Jan Peters},
  journal= {arXiv preprint arXiv:2010.14771},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2001.02435