中文

学习恢复:基于轮腿协调的动态奖励塑形用于倒下机器人

机器人学 2025-10-09 v2 人工智能 机器学习

摘要

从倒下事件进行自适应恢复是实际部署轮腿机器人不可或缺的技能,这些机器人独特地将腿部的灵活性与轮子的速度相结合,以实现快速恢复。然而,依赖预计划恢复运动、简化动力学或稀疏奖励的传统方法常常难以产生稳健的恢复策略。本文提出了一种基于学习的框架,集成了基于情节的动态奖励塑形与课程学习,动态平衡探索多样化恢复机动与精确姿态细化。一种非对称演员-批评架构通过利用仿真中的特权信息加速训练,同时加入噪声注入的观察可增强对不确定性的鲁棒性。我们进一步展示了,轮腿协同运动通过能量传递机制可将关节扭矩消耗降低 15.8% 和 26.2%,并提高稳定性。对两种不同四足平台的广泛评估实现了最高达 99.1% 和 97.8% 的恢复成功率,无需针对平台进行调优。补充材料可在 https://boyuandeng.github.io/L2R-WheelLegCoordination/ 查看。

关键词

引用

@article{arxiv.2506.05516,
  title  = {Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots},
  author = {Boyuan Deng and Luca Rossini and Jin Wang and Weijie Wang and Dimitrios Kanoulas and Nikolaos Tsagarakis},
  journal= {arXiv preprint arXiv:2506.05516},
  year   = {2025}
}