批处理深度强化学习算法基准评测
机器学习
2019-10-07 v1 人工智能
机器学习
摘要
广泛使用的深度强化学习算法已被证明在批处理设定下会失效——即从固定数据集中学习而不与环境交互。在此结果之后,已有若干论文在各种环境和批处理设定下展示了合理的性能。在本文中,我们在 Atari 领域、由单一部分训练的行为策略生成数据的统一设定下,对近期的离策略与批处理强化学习算法的性能进行基准评测。我们发现,在这些条件下,许多此类算法的表现不及使用相同数据量在线训练的 DQN,也不及该部分训练的行为策略。为引入一个强基线,我们将批处理约束 Q 学习算法适配到离散动作设定,并展示其在该任务上优于所有现有算法。
引用
@article{arxiv.1910.01708,
title = {Benchmarking Batch Deep Reinforcement Learning Algorithms},
author = {Scott Fujimoto and Edoardo Conti and Mohammad Ghavamzadeh and Joelle Pineau},
journal= {arXiv preprint arXiv:1910.01708},
year = {2019}
}
备注
Deep RL Workshop NeurIPS 2019