中文

用策略梯度方法控制倒立摆——教程

机器学习 2021-05-18 v1 人工智能 机器人学

摘要

本文给出了实现两种重要策略梯度方法以解决倒立摆问题的细节。这两种方法分别是深度确定性策略梯度(DDPG)和近端策略优化(PPO)算法。该问题通过 actor-critic 模型求解,其中 actor 网络用于学习策略函数,critic 网络通过学习估计 Q 函数来评估 actor 网络。除简要解释这两种算法背后的数学原理外,本文还提供了 Python 实现细节,有助于揭开算法底层复杂性的面纱。在此过程中,读者将接触到用于实现上述概念的 OpenAI/Gym、Tensorflow 2.x 和 Keras 工具。

关键词

引用

@article{arxiv.2105.07998,
  title  = {Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial},
  author = {Swagat Kumar},
  journal= {arXiv preprint arXiv:2105.07998},
  year   = {2021}
}

备注

8 pages, 3 figures, 2 tables etc