结合回放缓冲区的在策略信赖域策略优化
机器学习
2019-01-21 v1 人工智能
机器学习
摘要
基于深度强化学习方法近期的成功,我们研究通过复用若干连续策略的数据来改进在策略强化学习的可能性。在策略方法带来诸多益处,例如能够评估每个所得策略。然而,它们通常丢弃关于此前存在策略的所有信息。本工作中,我们提出改编从离策略学习设定借用的回放缓冲区概念,以创建一种结合在策略与离策略学习优势的方法。为此,所提算法对来自多策略数据的函数、值函数与优势函数进行推广。该方法使用信赖域优化,同时避免TRPO或ACKTR等算法的一些常见问题:它使用超参数替代信赖域选择启发式,并使用可训练协方差矩阵替代固定协方差矩阵。在许多情况下,该方法不仅相较于最先进的信赖域在策略学习算法(如PPO、ACKTR和TRPO)改善结果,而且相对于其离策略对应方法DDPG也有所提升。
引用
@article{arxiv.1901.06212,
title = {On-Policy Trust Region Policy Optimisation with Replay Buffers},
author = {Dmitry Kangin and Nicolas Pugeault},
journal= {arXiv preprint arXiv:1901.06212},
year = {2019}
}