中文

用于无演示仿人机器人运动的降阶模型引导强化学习

机器人学 2025-09-24 v1 人工智能

摘要

我们引入了降阶模型引导强化学习(Reduced-Order Model-Guided Reinforcement Learning, ROM-GRL),这是一种用于仿人机器人行走的两阶段强化学习框架,无需运动捕捉数据或复杂的奖励塑造。在第一阶段,通过近端策略优化(Proximal Policy Optimization)训练一个紧凑的 4 自由度(four-degree-of-freedom)降阶模型(Reduced-Order Model, ROM)。该模型生成节能的步态模板。在第二阶段,这些动力学一致的轨迹引导使用 Soft Actor-Critic 训练的全身策略,并结合对抗判别器进行增强,确保学生模型的五维步态特征分布与 ROM 的演示相匹配。在 1 米/秒和 4 米/秒速度下的实验表明,ROM-GRL 产生了稳定、对称的步态,其跟踪误差显著低于纯奖励基线。通过将轻量级 ROM 的指导蒸馏到高维策略中,ROM-GRL 弥合了纯奖励方法与基于模仿的运动方法之间的差距,无需任何人类演示即可实现多功能、自然的仿人机器人行为。

关键词

引用

@article{arxiv.2509.19023,
  title  = {Reduced-Order Model-Guided Reinforcement Learning for Demonstration-Free Humanoid Locomotion},
  author = {Shuai Liu and Meng Cheng Lau},
  journal= {arXiv preprint arXiv:2509.19023},
  year   = {2025}
}

备注

11 pages, 5 figures, 1 table, Computational Science Graduate Project