中文

双足运动中的仿真到实机迁移

机器人学 2019-08-27 v2 机器学习

摘要

我们提出了一种将动态机器人控制策略(如双足运动)从仿真迁移到真实硬件的新方法。我们方法的关键在于分两个不同阶段对硬件的模型参数 {\mu}(例如摩擦、质心)进行系统辨识:策略学习前(预系统辨识)与策略学习后(后系统辨识)。预系统辨识首先基于一组通用运动序列从物理硬件收集轨迹。由于这些轨迹可能与感兴趣的任务无关,预系统辨识并不试图准确辨识 {\mu} 的真值,而仅近似 {\mu} 的范围以指导策略学习。接下来,通过同时训练一个将 {\mu} 投影到低维潜变量 {\eta} 的网络以及一族以 {\eta} 为条件的策略,创建出投影通用策略(PUP)。随后,利用与任务相关的轨迹在机器人硬件上部署 PUP,进行第二轮系统辨识(后系统辨识)。我们使用贝叶斯优化来确定使 PUP 在真实硬件上性能最优的 {\eta} 值。我们已使用该方法在 Darwin OP2 机器人上创建了三个成功的双足运动控制器(向前走、向后走、侧向走)。

关键词

引用

@article{arxiv.1903.01390,
  title  = {Sim-to-Real Transfer for Biped Locomotion},
  author = {Wenhao Yu and Visak CV Kumar and Greg Turk and C. Karen Liu},
  journal= {arXiv preprint arXiv:1903.01390},
  year   = {2019}
}

备注

International Conference on Intelligent Robots and Systems (IROS), 2019