优势加权回归:简单且可扩展的离策略强化学习
机器学习
2019-10-09 v3 机器学习
摘要
在本文中,我们旨在开发一种简单且可扩展的强化学习算法,该算法使用标准监督学习方法作为子例程。我们的目标是提供一种仅利用简单且收敛的最大似然损失函数,同时也能利用离策略数据的算法。我们提出的方法称为优势加权回归 (AWR),由两个标准监督学习步骤组成:一个用于回归价值函数的目标值,另一个用于回归策略的加权目标动作。该方法简单且通用,可处理连续与离散动作,并能在标准监督学习方法之上仅用几行代码实现。我们为 AWR 提供了理论动机,并分析了其在结合来自经验回放的离策略数据时的性质。我们在一系列标准 OpenAI Gym 基准任务上评估 AWR,并表明其相较于多种成熟的 SOTA RL 算法具有竞争性能。当从纯静态数据集学习而无额外环境交互时,AWR 也能比大多数离策略算法获得更有效的策略。此外,我们在具有高度复杂模拟角色的困难连续控制任务上演示了我们的算法。
引用
@article{arxiv.1910.00177,
title = {Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning},
author = {Xue Bin Peng and Aviral Kumar and Grace Zhang and Sergey Levine},
journal= {arXiv preprint arXiv:1910.00177},
year = {2019}
}