中文

基于强化学习的三维Digit双足机器人鲁棒反馈运动策略设计

机器人学 2021-03-30 v1

摘要

本文提出一种用于学习双足运动的分层鲁棒框架,并成功在Agility Robotics制造的3D双足机器人Digit上实现。我们提出了一种将学习过程与直观反馈调节相结合的级联结构控制器。该设计使框架能够以降维的策略状态与动作空间实现鲁棒稳定的行走,显著简化了设计并降低了学习方法的采样代价。将反馈调节纳入框架提高了所学行走步态的鲁棒性,并以最小调参确保了所提控制器的仿真到实机的成功迁移。我们具体给出了一种学习流程,其在学习过程中考虑机器人硬件可行的初始姿态,以保证学习的初始状态尽可能复现硬件实验中机器人的初始状态。最后,我们通过在仿真中将所学策略成功迁移至Digit机器人硬件,实现了在外部力扰动及训练过程未包含的挑战性地形下的持续行走步态,证明了方法的可行性。据我们所知,这是首次在没有使用动态随机化或课程学习的情况下,将基于学习的策略成功迁移至Digit机器人硬件实验。

关键词

引用

@article{arxiv.2103.15309,
  title  = {Robust Feedback Motion Policy Design Using Reinforcement Learning on a 3D Digit Bipedal Robot},
  author = {Guillermo A. Castillo and Bowen Weng and Wei Zhang and Ayonga Hereid},
  journal= {arXiv preprint arXiv:2103.15309},
  year   = {2021}
}

备注

"Supplemental video: https://www.youtube.com/watch?v=j8KbW-a9dbw"