从MPC进行模仿学习以实现四足机器人多步态控制
机器人学
2021-12-01 v1 人工智能
系统与控制
系统与控制
摘要
我们提出一种学习算法,用于训练单一策略来模仿行走机器人的多种步态。为此,我们使用并扩展MPC-Net——一种由模型预测控制(MPC)引导的模仿学习方法。MPC-Net的策略不同于许多其他方法,其目标是最小化控制哈密顿量,这源于最优性原理。为表示策略,我们采用专家混合网络(MEN),并观察到若MEN中每个专家专门控制混合系统(如行走机器人)的恰好一种模式,则策略性能提升。我们为单步态与多步态策略引入新的损失函数以实现此类专家选择行为。此外,我们在多种崎岖地形场景中将我们的算法与行为克隆及原始MPC实现进行基准对比。我们在硬件上验证了该方法,并表明单一学习到的策略可替代其教师来控制多种步态。
引用
@article{arxiv.2103.14331,
title = {Imitation Learning from MPC for Quadrupedal Multi-Gait Control},
author = {Alexander Reske and Jan Carius and Yuntao Ma and Farbod Farshidian and Marco Hutter},
journal= {arXiv preprint arXiv:2103.14331},
year = {2021}
}