中文

批处理深度强化学习算法基准评测

机器学习 2019-10-07 v1 人工智能 机器学习

摘要

广泛使用的深度强化学习算法已被证明在批处理设定下会失效——即从固定数据集中学习而不与环境交互。在此结果之后,已有若干论文在各种环境和批处理设定下展示了合理的性能。在本文中,我们在 Atari 领域、由单一部分训练的行为策略生成数据的统一设定下,对近期的离策略与批处理强化学习算法的性能进行基准评测。我们发现,在这些条件下,许多此类算法的表现不及使用相同数据量在线训练的 DQN,也不及该部分训练的行为策略。为引入一个强基线,我们将批处理约束 Q 学习算法适配到离散动作设定,并展示其在该任务上优于所有现有算法。

关键词

引用

@article{arxiv.1910.01708,
  title  = {Benchmarking Batch Deep Reinforcement Learning Algorithms},
  author = {Scott Fujimoto and Edoardo Conti and Mohammad Ghavamzadeh and Joelle Pineau},
  journal= {arXiv preprint arXiv:1910.01708},
  year   = {2019}
}

备注

Deep RL Workshop NeurIPS 2019