用强化学习平衡 CartPole 系统——一篇教程
机器人学
2020-06-15 v2 机器学习
摘要
在本文中,我们给出实现多种强化学习(RL)算法来控制 Cart-Pole 系统的细节。特别地,我们描述了多种 RL 概念,如 Q-learning、Deep Q Networks(DQN)、Double DQN、Dueling networks、(优先)经验回放,并展示它们对学习性能的影响。在此过程中,读者将接触到用于实现上述概念的 OpenAI/Gym 和 Keras 工具。观察到带 PER 的 DQN 在所有架构中提供最佳性能,能够在 150 个回合内解决问题。
引用
@article{arxiv.2006.04938,
title = {Balancing a CartPole System with Reinforcement Learning -- A Tutorial},
author = {Swagat Kumar},
journal= {arXiv preprint arXiv:2006.04938},
year = {2020}
}
备注
8 pages, 8 figures, 15 code listings and one table