基于离策略评论家的样本高效无模型强化学习
机器学习
2019-06-13 v2 人工智能
摘要
基于价值的强化学习算法在无模型离散动作设定下提供了最先进的结果,并往往优于 actor-critic 算法。我们认为 actor-critic 算法受其对于同策略评论家的需求所限制。我们提出自举双重策略迭代(BDPI),一种用于连续状态与离散动作的新型无模型强化学习算法,带有一个 actor 与若干离策略评论家。离策略评论家与经验回放兼容,确保了高样本效率,而无需离策略修正。actor 通过缓慢模仿评论家的平均贪心策略,带来高质量且状态特定的探索,我们将其与 Thompson 采样进行比较。由于 actor 与评论家完全解耦,BDPI 异常稳定,且对其超参数异常鲁棒。BDPI 在离散、连续及基于像素的任务上显著比 Bootstrapped DQN、PPO 和 ACKTR 更具样本效率。源代码:https://github.com/vub-ai-lab/bdpi。
引用
@article{arxiv.1903.04193,
title = {Sample-Efficient Model-Free Reinforcement Learning with Off-Policy Critics},
author = {Denis Steckelmacher and Hélène Plisnier and Diederik M. Roijers and Ann Nowé},
journal= {arXiv preprint arXiv:1903.04193},
year = {2019}
}
备注
Accepted at the European Conference on Machine Learning 2019 (ECML)