中文

期望策略梯度

机器学习 2018-04-17 v6 机器学习

摘要

我们提出了期望策略梯度(EPG),它统一了强化学习中的随机策略梯度(SPG)和确定性策略梯度(DPG)。受 expected sarsa 启发,EPG 在估计梯度时对动作进行积分,而不是仅依赖采样轨迹中的动作。我们建立了一个新的通用策略梯度定理,随机和确定性策略梯度定理是其特例。我们还证明,EPG 在不需要确定性策略的情况下降低了梯度估计的方差,且对于高斯情形没有额外计算开销。最后,我们表明,在某种意义上,使用高斯策略进行探索是最优的,使得协方差与评论家关于动作的缩放 Hessian 矩阵的指数成正比。我们给出的实验结果证实,这种新的探索形式在四个具有挑战性的 MuJoCo 领域中显著优于使用 Ornstein-Uhlenbeck 启发式的 DPG。

关键词

引用

@article{arxiv.1706.05374,
  title  = {Expected Policy Gradients},
  author = {Kamil Ciosek and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1706.05374},
  year   = {2018}
}

备注

Conference paper, AAAI-18, 12 pages including supplement