中文

TOLEBI:基于在线状态估计与易损性奖励的双足 locomotion 容错学习

机器人学 2026-03-05 v2

摘要

随着学习算法在机器人应用中的广泛采用,基于强化学习的双足 locomotion 研究已成为人oid 机器人领域的核心议题。虽然近期研究取得了高成功率的 locomotion 任务,但对开发能够处理 locomotion 过程中硬件故障的方法关注不足。然而,在实际场景下,环境干扰或硬件故障的突发发生可能导致严重后果。为此,本文提出了 TOLEBI(faulT-tOlerant Learning framEwork for Bipedal locomotIon),用于在运行期间处理机器人上的故障。具体而言,本文在仿真中注入关节锁定、功率损失和外部干扰,以学习容错 locomotion 策略。除通过仿真到真实机器人的策略迁移外,还引入在线关节状态模块。该模块可在真实世界条件下通过参考运行时的实际观察来分类关节状态。通过 humanoid 机器人 TOCABI 在真实世界和仿真中的验证实验,证明了所提方法的可行性。据我们所知,本文提供了首个基于学习的双足 locomotion 容错框架,促进了该领域高效学习方法的发展。

关键词

引用

@article{arxiv.2602.05596,
  title  = {TOLEBI: Learning Fault-Tolerant Bipedal Locomotion via Online Status Estimation and Fallibility Rewards},
  author = {Hokyun Lee and Woo-Jeong Baek and Junhyeok Cha and Jaeheung Park},
  journal= {arXiv preprint arXiv:2602.05596},
  year   = {2026}
}

备注

Accepted for Publication at IEEE International Conference on Robotics and Automation (ICRA) 2026