基于强化学习增强的非足迹行走与混合 locomotion 的模型预测控制
机器人学
2026-03-24 v1
摘要
我们提出了一种基于接触显式的分层架构,将强化学习 (RL) 与模型预测控制 (MPC) 耦合,其中高级 RL 智能体为低级 locomotion MPC 提供步态和导航指令。这通过在仿真中通过试错学习无环步态,卸载了 MPC 对接触时序的组合负担。我们表明,仅需最小化的奖励集合和有限的调参,即可获得有效策略。我们在仿真环境中对 50 kg 至 120 kg 不同机器人平台和不同 MPC 实现进行了验证,观察到在平地 terrain 上的足迹 locomotion 和混合 locomotion 中出现无环步态及时序适应,并进一步演示了对非平坦 terrain 的可扩展性。在所有平台上,我们实现了零Shot sim-to-sim 迁移,且未使用域随机化,进一步在 Centauro 我们的 120 kg 轮足人形机器人上实现了零Shot sim-to-real 迁移,且未使用域随机化。我们将软件框架和评估结果公开于 https://github.com/AndrePatri/AugMPC。
关键词
引用
@article{arxiv.2603.10878,
title = {RL-Augmented MPC for Non-Gaited Legged and Hybrid Locomotion},
author = {Andrea Patrizi and Carlo Rizzardo and Arturo Laurenzi and Francesco Ruscelli and Luca Rossini and Nikos G. Tsagarakis},
journal= {arXiv preprint arXiv:2603.10878},
year = {2026}
}