中文

基于自演化先验的跳跃式强化学习:面对极端单足行走

机器人学 2025-07-03 v1 机器学习

摘要

强化学习(RL)已显示出在使四足机器人实现敏捷行走方面的巨大潜力。然而,直接训练策略以同时处理极端单足跳跃任务中所面临的两大极端挑战——极端欠驱动与极端 terrain,仍然极具挑战性,因为早期阶段的交互不稳定且奖励反馈不可靠。为此,本文提出JumpER(jump-start reinforcement learning via self-evolving priors),一种结构化策略学习的RL训练框架,将学习过程分为多个递增复杂度的阶段。通过动态生成自演化先验(通过先前学习的策略进行迭代引导),JumpER逐步细化和提升指导效果,从而在不依赖外部专家先验或手工设计奖励函数的情况下,稳定探索和策略优化。具体而言,当集成一个结构化的三个阶段课程(逐步演化动作模态、观察空间和任务目标)时,JumpER首次使四足机器人能够在不可预测的 terrain 上实现稳健的单足跳跃。惊人的是,所得策略有效处理了传统方法难以应对的挑战性场景,包括最高可达60厘米的宽缝、不规则的楼梯,以及步石间距从15厘米到35厘米不等的情形。JumpER因此为解决在极端欠驱动和极端 terrain 双重挑战下的行走任务提供了一种原则且可扩展的方法。

关键词

引用

@article{arxiv.2507.01243,
  title  = {Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion},
  author = {Ziang Zheng and Guojian Zhan and Shiqi Liu and Yao Lyu and Tao Zhang and Shengbo Eben Li},
  journal= {arXiv preprint arXiv:2507.01243},
  year   = {2025}
}