中文

基于周期奖励组合实现所有常见双足步态的仿真到现实学习

机器人学 2021-03-12 v2

摘要

我们研究通过仿真到现实强化学习(RL)在真实机器人上实现完整双足运动谱的问题。学习腿式运动的一个关键挑战是以奖励函数描述不同步态,这种方式对设计者直观,且足够具体以跨不同初始随机种子或超参数可靠地学习该步态。一种常见方法是使用参考运动(例如关节位置轨迹)来引导学习。然而,寻找高质量参考运动可能困难,且轨迹本身狭窄地约束了所学运动空间。另一极端,无参考奖励函数常欠指定(例如向前移动),导致策略行为巨大方差,或是经试错大量奖励塑形后的产物,使其仅适用于特定步态。在本工作中,我们提出一种基于在基本力和速度上组合简单概率周期代价的奖励指定框架。我们实例化该框架以定义具有直观设置的参数化奖励函数,涵盖所有常见双足步态——站立、行走、跳跃、奔跑和蹦跳。利用该函数,我们展示了所学步态向双足机器人Cassie的成功仿真到现实迁移,以及能在所有双拍步态间切换的通用策略。

关键词

引用

@article{arxiv.2011.01387,
  title  = {Sim-to-Real Learning of All Common Bipedal Gaits via Periodic Reward Composition},
  author = {Jonah Siekmann and Yesh Godse and Alan Fern and Jonathan Hurst},
  journal= {arXiv preprint arXiv:2011.01387},
  year   = {2021}
}

备注

Accepted for presentation at ICRA 2021. The first two authors contributed equally to this work