中文

利用强化学习教机器人行走

机器学习 2021-12-15 v1 机器人学

摘要

PID 与 LQR 等经典控制技术已有效用于维持系统状态,但当模型动态复杂性及敏感性增加时,这些技术愈发难以实施。对于具有多个自由度的自适应机器人运动任务,经典控制技术变得不可行。相反,强化学习可轻松训练最优行走策略。我们应用深度 Q 学习与增强随机搜索(ARS)在 OpenAI Gym BipedalWalker-v3 环境中教一个模拟的二维双足机器人行走。深度 Q 学习未产生高奖励策略,常因粗略离散化的动作空间而过早收敛至次优局部极大值。然而 ARS 训练出的机器人更优,并产生了一种正式“解决” BipedalWalker-v3 问题的最优策略。多种朴素策略,包括随机策略、手动编码的前移策略与静止策略,被用作基准以评估学习算法结果的熟练度。

关键词

引用

@article{arxiv.2112.07031,
  title  = {Teaching a Robot to Walk Using Reinforcement Learning},
  author = {Jack Dibachi and Jacob Azoulay},
  journal= {arXiv preprint arXiv:2112.07031},
  year   = {2021}
}

备注

6 pages, 9 figures