中文

无探索的离策略深度强化学习

机器学习 2019-08-13 v3 人工智能 机器学习

摘要

强化学习的许多实际应用将智能体限制于从已收集的固定批次数据中学习,而不提供进一步收集数据的可能性。在本文中,我们证明由于外推引入的误差,标准的离策略深度强化学习算法(如 DQN 和 DDPG)无法学习与当前策略下分布不相关的数据,这使得它们在固定批次设定下无效。我们提出了一类新颖的离策略算法——批约束强化学习,其通过限制动作空间来迫使智能体在给定数据子集上表现得接近在线策略。我们提出了首个能够从任意固定批次数据中有效学习的连续控制深度强化学习算法,并在若干任务中经验性地展示了其行为质量。

关键词

引用

@article{arxiv.1812.02900,
  title  = {Off-Policy Deep Reinforcement Learning without Exploration},
  author = {Scott Fujimoto and David Meger and Doina Precup},
  journal= {arXiv preprint arXiv:1812.02900},
  year   = {2019}
}

备注

ICML 2019