中文

广义离策略 Actor-Critic

机器学习 2019-10-29 v8 人工智能 机器学习

摘要

我们提出了一个新的目标——反事实目标,在持续强化学习(RL)设定下统一了现有的离策略策略梯度算法目标。与常用且可能在部署时误导关于目标策略性能的游历目标相比,我们的新目标能更好地预测此类性能。我们证明了广义离策略策略梯度定理以计算反事实目标的策略梯度,并采用强调方法从该策略梯度中获得无偏样本,从而得到广义离策略 Actor-Critic(Geoff-PAC)算法。我们在 Mujoco 机器人仿真任务中展示了 Geoff-PAC 优于现有算法的优势,这是强调算法在主流深度 RL 基准中的首次实证成功。

关键词

引用

@article{arxiv.1903.11329,
  title  = {Generalized Off-Policy Actor-Critic},
  author = {Shangtong Zhang and Wendelin Boehmer and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1903.11329},
  year   = {2019}
}

备注

NeurIPS 2019