期望策略梯度
机器学习
2018-04-17 v6 机器学习
摘要
我们提出了期望策略梯度(EPG),它统一了强化学习中的随机策略梯度(SPG)和确定性策略梯度(DPG)。受 expected sarsa 启发,EPG 在估计梯度时对动作进行积分,而不是仅依赖采样轨迹中的动作。我们建立了一个新的通用策略梯度定理,随机和确定性策略梯度定理是其特例。我们还证明,EPG 在不需要确定性策略的情况下降低了梯度估计的方差,且对于高斯情形没有额外计算开销。最后,我们表明,在某种意义上,使用高斯策略进行探索是最优的,使得协方差与评论家关于动作的缩放 Hessian 矩阵的指数成正比。我们给出的实验结果证实,这种新的探索形式在四个具有挑战性的 MuJoCo 领域中显著优于使用 Ornstein-Uhlenbeck 启发式的 DPG。
引用
@article{arxiv.1706.05374,
title = {Expected Policy Gradients},
author = {Kamil Ciosek and Shimon Whiteson},
journal= {arXiv preprint arXiv:1706.05374},
year = {2018}
}
备注
Conference paper, AAAI-18, 12 pages including supplement