基于动作相关分解基线的策略梯度方差缩减
机器学习
2018-03-21 v1 人工智能
机器学习
摘要
策略梯度方法在深度强化学习中取得了巨大成功,但饱受梯度估计高方差之苦。在长视界或高维动作空间的问题中,高方差问题尤为加剧。为了缓解这一问题,我们推导了一种无偏的动作相关基线用于方差缩减,该基线充分利用了随机策略本身的结构形式,且不对 MDP 做任何额外假设。我们通过理论分析和数值结果证明并量化了动作相关基线的优势,包括对最优状态相关基线次优性的分析。最终得到一种计算高效的策略梯度算法,可扩展至高维控制问题,并通过一个合成的 2000 维目标匹配任务进行了验证。实验结果表明,动作相关基线能够在标准强化学习基准、高维手部操作以及合成任务中实现更快的学习。最后,我们表明,将额外信息纳入基线以改善方差缩减的通用思想可以扩展到部分可观测和多智能体任务中。
引用
@article{arxiv.1803.07246,
title = {Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines},
author = {Cathy Wu and Aravind Rajeswaran and Yan Duan and Vikash Kumar and Alexandre M Bayen and Sham Kakade and Igor Mordatch and Pieter Abbeel},
journal= {arXiv preprint arXiv:1803.07246},
year = {2018}
}
备注
Accepted to ICLR 2018, Oral (2%)