野生环境中四足机器人运行时学习
机器人学
2025-09-22 v2
摘要
本文提出了一种针对四足机器人运行时学习的框架,使其能够在动态野生环境中安全地学习和适应。该框架集成了感知、导航和控制模块,形成一个闭环系统。该框架的核心创新点在于控制模块中两个互动且互补的组成部分:高性能(HP)学生和高保障(HA)教师。HP学生是深度强化学习(DRL)智能体,进行自我学习和教学,以学习出安全且高性能的动作策略。HA教师是一种简化且可验证的物理模型控制器,其作用是关于安全性教育HP学生,同时为机器人的安全 locomotion 提供备份。HA教师因其实时物理模型、实时动作策略和实时控制目标而创新,这些要素都针对有效应对野生环境的实时情况,确保安全。该框架还包括一个协调器,有效管理HP学生和HA教师之间的交互。实验使用 Unitree Go2 机器人在 Nvidia Isaac Gym 中进行,与最先进的安全 DRL 进行比较,证明了所提出运行时学习框架的有效性。
引用
@article{arxiv.2503.04794,
title = {Runtime Learning of Quadruped Robots in Wild Environments},
author = {Yihao Cai and Yanbing Mao and Lui Sha and Hongpeng Cao and Marco Caccamo},
journal= {arXiv preprint arXiv:2503.04794},
year = {2025}
}