中文

基于混合零动力学启发的强化学习三维双足行走反馈控制策略设计

机器人学 2019-10-07 v1 机器学习 神经与进化计算

摘要

本文提出一种新颖的无模型强化学习(RL)框架,用于设计三维双足行走的反馈控制策略。现有的RL算法通常以端到端方式训练,或依赖于某些参考关节轨迹的先验知识。与这些研究不同,我们提出一种新颖的策略结构,恰当地融合了从行走动力学的混合特性以及成熟的三维双足行走混合零动力学方法中获得的物理洞见。因此,整个RL框架具有若干关键优势,包括轻量级网络结构、训练时间短以及对先验知识的依赖较少。我们在具有挑战性的三维双足机器人Cassie上验证了所提方法的有效性。所提出的解决方案产生了稳定的极限行走环,能够跟踪不同方向上的各种行走速度。令人惊讶的是,即使没有专门针对扰动进行鲁棒性训练,它也能对施加于躯干向前和向后方向的各种对抗性力表现出鲁棒性。

关键词

引用

@article{arxiv.1910.01748,
  title  = {Hybrid Zero Dynamics Inspired Feedback Control Policy Design for 3D Bipedal Locomotion using Reinforcement Learning},
  author = {Guillermo A. Castillo and Bowen Weng and Wei Zhang and Ayonga Hereid},
  journal= {arXiv preprint arXiv:1910.01748},
  year   = {2019}
}

备注

Supplemental video: https://youtu.be/GOT6bnxqwuU