强化学习遇上混合零动态:以 RABBIT 为例的研究
机器人学
2018-10-05 v1
摘要
由于双足机器人动力学的混合特性以及高维双足模型带来的复杂性,其反馈控制器设计具有挑战性。在本文中,我们提出了一种使用强化学习(RL)和混合零动态(HZD)设计反馈控制器的新型方法。现有的双足行走 RL 方法效率低下,因为它们不考虑底层物理,通常需要大量训练,且所得控制器可能不适用于真实机器人。HZD 是一种强大的双足控制工具,对行走极限环具有局部稳定性保证。在本文中,我们提出了一种将 HZD 框架嵌入策略学习的非传统 RL 结构。更具体地说,我们提议使用 RL 来寻找一种控制策略,该策略从机器人的降阶状态映射到一组参数,这些参数通过虚拟约束定义机器人关节的期望轨迹。然后,这些轨迹由自适应 PD 控制器跟踪。该方法产生了一种稳定且鲁棒的控制策略,能够在连续区间内跟踪变速。策略的鲁棒性通过对机器人躯干施加外力来评估。所提出的 RL 框架在基于著名 RABBIT 机器人模型的 OpenAI Gym 和 MuJoCo 物理引擎中实现并演示。
引用
@article{arxiv.1810.01977,
title = {Reinforcement Learning Meets Hybrid Zero Dynamics: A Case Study for RABBIT},
author = {Guillermo A. Castillo and Bowen Weng and Ayonga Hereid and Wei Zhang},
journal= {arXiv preprint arXiv:1810.01977},
year = {2018}
}
备注
Supplemental video: https://www.youtube.com/watch?v=dhHMfnl7YlU