面向动态鲁棒腿式运动的控制策略与状态估计器并发训练
机器人学
2022-03-03 v2 机器学习
系统与控制
系统与控制
摘要
在本文中,我们提出了一种运动训练框架,其中控制策略与状态估计器被并发训练。该框架由一个输出期望关节位置的政策网络,以及一个输出机器人状态估计值(如基座线速度、足端高度和接触概率)的状态估计网络组成。我们利用快速仿真环境训练这些网络,并将训练好的网络迁移到真实机器人上。所训练的策略与状态估计器能够穿越多种地形,如山坡、打滑板和颠簸路面。我们还展示了学习到的策略在普通平地上最高可达 3.75 m/s、在摩擦系数为 0.22 的打滑板上可达 3.54 m/s 的速度运行。
引用
@article{arxiv.2202.05481,
title = {Concurrent Training of a Control Policy and a State Estimator for Dynamic and Robust Legged Locomotion},
author = {Gwanghyeon Ji and Juhyeok Mun and Hyeongjun Kim and Jemin Hwangbo},
journal= {arXiv preprint arXiv:2202.05481},
year = {2022}
}
备注
Accepted for IEEE Robotics and Automation Letters (RA-L) and ICRA 2022