中文

用强化学习平衡 CartPole 系统——一篇教程

机器人学 2020-06-15 v2 机器学习

摘要

在本文中,我们给出实现多种强化学习(RL)算法来控制 Cart-Pole 系统的细节。特别地,我们描述了多种 RL 概念,如 Q-learning、Deep Q Networks(DQN)、Double DQN、Dueling networks、(优先)经验回放,并展示它们对学习性能的影响。在此过程中,读者将接触到用于实现上述概念的 OpenAI/Gym 和 Keras 工具。观察到带 PER 的 DQN 在所有架构中提供最佳性能,能够在 150 个回合内解决问题。

关键词

引用

@article{arxiv.2006.04938,
  title  = {Balancing a CartPole System with Reinforcement Learning -- A Tutorial},
  author = {Swagat Kumar},
  journal= {arXiv preprint arXiv:2006.04938},
  year   = {2020}
}

备注

8 pages, 8 figures, 15 code listings and one table