GPO:Legged Robot Locomotion and Whole-Body Control的Growing Policy Optimization
机器人学
2026-01-29 v1
摘要
为Legged机器人 locomotion 和 whole-body control 训练强化学习(RL)策略仍具有挑战性,原因在于高维连续动作、硬件约束以及有限的探索。现有方法在基于位置的控制(例如奖励引导、课程设计和手动初始化)下表现良好,但对于基于扭矩的控制则不够有效,后者需要更充分地探索动作空间并获取信息丰富的梯度信号。我们引入Growing Policy Optimization(GPO),一种训练框架,通过时变动作转换限制早期阶段的有效动作空间,从而鼓励更有效的数据收集和策略学习,然后逐渐扩大范围以实现更高的预期回报。我们证明,这种转换保留了PPO更新规则,仅引入受限且渐消的梯度扭曲,从而确保训练稳定。我们在四足和六足机器人上评估了GPO,包括将仿真训练的策略零样部署到硬件。使用GPO训练的策略在性能上 consistently 获得更好结果。这些结果表明,GPO 提供了一种通用、环境无关的优化框架,用于学习Legged locomotion。
引用
@article{arxiv.2601.20668,
title = {GPO: Growing Policy Optimization for Legged Robot Locomotion and Whole-Body Control},
author = {Shuhao Liao and Peizhuo Li and Xinrong Yang and Linnan Chang and Zhaoxin Fan and Qing Wang and Lei Shi and Yuhong Cao and Wenjun Wu and Guillaume Sartoretti},
journal= {arXiv preprint arXiv:2601.20668},
year = {2026}
}