中文

基于深度确定性策略梯度的双足行走机器人

机器人学 2018-07-18 v2 人工智能 机器学习

摘要

机器学习算法已在机器人学与控制系统领域找到诸多应用。控制系统的学界已开始关注来自监督学习、模仿学习与强化学习等子领域的多种机器学习算法,以实现自主控制与智能决策。在众多复杂控制问题中,稳定双足行走一直是最具挑战性的问题。本文提出一种利用真实机器人仿真器 Gazebo 设计与仿真平面双足行走机器人(BWR)的架构。该机器人通过大量试错学习,无需自身或世界动力学的任何先验知识,即展现出成功的行走行为。BWR 的自主行走通过称为深度确定性策略梯度(DDPG)的强化学习算法实现。DDPG 是连续动作空间中学习控制的算法之一。在仿真中训练模型后观察到,借助适当成形的奖励函数,机器人实现了更快行走甚至以平均 0.83 m/s 的速度呈现出跑步步态。双足行走者的步态模式与实际人类行走模式进行了比较。结果表明双足行走模式具有与人类行走模式相似的特征。展示我们实验的视频可在 https://goo.gl/NHXKqR 获取。

关键词

引用

@article{arxiv.1807.05924,
  title  = {Bipedal Walking Robot using Deep Deterministic Policy Gradient},
  author = {Arun Kumar and Navneet Paul and S N Omkar},
  journal= {arXiv preprint arXiv:1807.05924},
  year   = {2018}
}

备注

Research manuscript submitted to IEEE Symposium Series on Computational Intelligence(SSCI), 2018