基于深度强化学习的连续控制
机器学习
2019-07-08 v6 机器学习
摘要
我们将深度Q学习成功背后的思想应用于连续动作域。我们提出了一种基于确定性策略梯度的、可运行于连续动作空间的无模型 actor-critic 算法。使用相同的学习算法、网络架构和超参数,我们的算法稳健地解决了超过20个模拟物理任务,包括经典问题如 cartpole swing-up、灵巧操作、腿式运动与汽车驾驶。我们的算法能够找到与规划算法(该算法可完全访问领域动力学及其导数)所找到策略性能相竞争的策略。我们进一步证明,对于许多任务,该算法可以端到端地学习策略:直接从原始像素输入。
引用
@article{arxiv.1509.02971,
title = {Continuous control with deep reinforcement learning},
author = {Timothy P. Lillicrap and Jonathan J. Hunt and Alexander Pritzel and Nicolas Heess and Tom Erez and Yuval Tassa and David Silver and Daan Wierstra},
journal= {arXiv preprint arXiv:1509.02971},
year = {2019}
}
备注
10 pages + supplementary