结合策略梯度与 Q-learning
机器学习
2017-04-10 v3 人工智能
最优化与控制
机器学习
摘要
策略梯度是在强化学习设定中改进策略的一种高效技术。然而,原始的在线变体仅为同策略,无法利用异策略数据。本文描述一种将策略梯度与异策略 Q-learning 相结合的新技术,从回放缓冲区中抽取经验。其动机在于建立正则化策略梯度算法的不动点与 Q 值之间的联系。该联系使我们能从策略的动作偏好估计 Q 值,并对其进行 Q-learning 更新。我们将此新技术称为 'PGQL'(policy gradient and Q-learning)。我们还建立了动作值拟合技术与 actor-critic 算法之间的等价性,表明正则化策略梯度技术可解释为优势函数学习算法。最后通过若干数值例子展示了 PGQL 改进的数据效率与稳定性。特别地,我们在完整的 Atari 游戏集上测试了 PGQL,其性能超过了异步优势 actor-critic (A3C) 与 Q-learning。
引用
@article{arxiv.1611.01626,
title = {Combining policy gradient and Q-learning},
author = {Brendan O'Donoghue and Remi Munos and Koray Kavukcuoglu and Volodymyr Mnih},
journal= {arXiv preprint arXiv:1611.01626},
year = {2017}
}