Q-Prop:具有离策略评论家的样本高效策略梯度
机器学习
2017-03-01 v3
摘要
无模型深度强化学习 (RL) 方法已在各种模拟领域取得成功。然而,深度 RL 在现实世界应用面临的主要障碍是其高样本复杂度。批量策略梯度方法提供了稳定的学习,但代价是高方差,这通常需要大批量数据。TD 风格的方法,如离策略 Actor-Critic 和 Q-learning,样本效率更高但存在偏差,且通常需要昂贵的超参数扫描来稳定。在本工作中,我们旨在开发结合策略梯度稳定性与离策略 RL 效率的方法。我们提出了 Q-Prop,这是一种利用离策略评论家的泰勒展开作为控制变量的策略梯度方法。Q-Prop 既样本高效又稳定,有效地结合了同策略和离策略方法的优点。我们分析了 Q-Prop 与现有无模型算法之间的联系,并利用控制变量理论推导出了具有保守和激进自适应特性的两种 Q-Prop 变体。我们表明,在 OpenAI Gym 的 MuJoCo 连续控制环境中,保守型 Q-Prop 相较于带有广义优势估计 (GAE) 的信任域策略优化 (TRPO) 在样本效率上提供了显著提升,并相较于深度确定性策略梯度 (DDPG)(当前最先进的同策略和离策略方法)提高了稳定性。
引用
@article{arxiv.1611.02247,
title = {Q-Prop: Sample-Efficient Policy Gradient with An Off-Policy Critic},
author = {Shixiang Gu and Timothy Lillicrap and Zoubin Ghahramani and Richard E. Turner and Sergey Levine},
journal= {arXiv preprint arXiv:1611.02247},
year = {2017}
}
备注
Conference Paper at the International Conference on Learning Representations (ICLR) 2017