学习恢复:基于轮腿协调的动态奖励塑形用于倒下机器人
机器人学
2025-10-09 v2 人工智能
机器学习
摘要
从倒下事件进行自适应恢复是实际部署轮腿机器人不可或缺的技能,这些机器人独特地将腿部的灵活性与轮子的速度相结合,以实现快速恢复。然而,依赖预计划恢复运动、简化动力学或稀疏奖励的传统方法常常难以产生稳健的恢复策略。本文提出了一种基于学习的框架,集成了基于情节的动态奖励塑形与课程学习,动态平衡探索多样化恢复机动与精确姿态细化。一种非对称演员-批评架构通过利用仿真中的特权信息加速训练,同时加入噪声注入的观察可增强对不确定性的鲁棒性。我们进一步展示了,轮腿协同运动通过能量传递机制可将关节扭矩消耗降低 15.8% 和 26.2%,并提高稳定性。对两种不同四足平台的广泛评估实现了最高达 99.1% 和 97.8% 的恢复成功率,无需针对平台进行调优。补充材料可在 https://boyuandeng.github.io/L2R-WheelLegCoordination/ 查看。
引用
@article{arxiv.2506.05516,
title = {Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots},
author = {Boyuan Deng and Luca Rossini and Jin Wang and Weijie Wang and Dimitrios Kanoulas and Nikolaos Tsagarakis},
journal= {arXiv preprint arXiv:2506.05516},
year = {2025}
}