基于斯坦因恒等式的动作相关控制变量用于策略优化
机器学习
2018-02-26 v4 机器学习
摘要
策略梯度方法在解决具有挑战性的强化学习问题中取得了显著成功。然而,它在策略梯度估计上仍经常受大方差问题困扰,导致训练期间样本效率低下。在这项工作中,我们提出一种控制变量方法来有效降低策略梯度方法的方差。受斯坦因恒等式启发,我们的方法通过引入更一般的动作相关基线函数,扩展了先前用于 REINFORCE 和优势 actor-critic 的控制变量方法。实证研究表明,我们的方法显著提升了最先进策略梯度方法的样本效率。
引用
@article{arxiv.1710.11198,
title = {Action-depedent Control Variates for Policy Optimization via Stein's Identity},
author = {Hao Liu and Yihao Feng and Yi Mao and Dengyong Zhou and Jian Peng and Qiang Liu},
journal= {arXiv preprint arXiv:1710.11198},
year = {2018}
}
备注
The first two authors contributed equally. Author ordering determined by coin flip over a Google Hangout. Accepted by ICLR 2018