修正的 Actor-Critic 方法
机器学习
2020-01-27 v2 人工智能
机器学习
摘要
近期成功的深度强化学习算法,如信赖域策略优化(TRPO)或近端策略优化(PPO),本质上是保守策略迭代(CPI)的变体。这些算法迭代执行策略评估而后接一个软化的策略改进步骤。因此,它们天然为同策略。本文中,我们提出将(任意类型的)软贪心与修正策略迭代(MPI)相结合。所提出的抽象框架重复应用:(i) 允许离策略学习的局部策略评估步骤,以及 (ii) 任意软化的贪心步骤。我们的贡献可视为深度强化学习工具箱中的一新通用工具。作为概念验证,我们用 PPO 贪心实例化该框架。与原始 PPO 的比较表明,我们的算法样本效率更高。我们还表明其与最先进的离策略算法软 Actor-Critic(SAC)具有竞争力。
引用
@article{arxiv.1907.01298,
title = {Modified Actor-Critics},
author = {Erinc Merdivan and Sten Hanke and Matthieu Geist},
journal= {arXiv preprint arXiv:1907.01298},
year = {2020}
}
备注
Long version of AAMAS 2020