PPF:基于模型假设正则化的人类 locomotion 预训练与保性微调
机器人学
2025-10-16 v2
摘要
人类 locomotion 是一个由于内在复杂性和高维动力学,以及需要适应多样且不可预测环境的挑战性任务。在本文中,我们引入了一个新颖的学习框架,用于有效训练人类 locomotion 策略,该策略模仿基于模型的控制器的行为,同时扩展其能力以处理更复杂的 locomotion 任务,如更具挑战性的地形和更高速度命令。我们的框架由三个关键组件构成:通过imitation学习的预训练,通过强化学习进行微调,以及在微调期间通过模型假设正则化 (MAR) 的fine-tuning。在 particular,MAR仅在模型假设成立的状态下将策略与基于模型的控制器的动作对齐,以防止灾难性遗忘。我们通过全面仿真测试和在全尺寸人类机器人 Digit 上的硬件实验来评估所提出的框架,展示了达到1.5 m/s 的前进速度以及在多样地形(包括光滑、斜坡、不规则和沙地)上的稳健 locomotion。
引用
@article{arxiv.2504.09833,
title = {PPF: Pre-training and Preservative Fine-tuning of Humanoid Locomotion via Model-Assumption-based Regularization},
author = {Hyunyoung Jung and Zhaoyuan Gu and Ye Zhao and Hae-Won Park and Sehoon Ha},
journal= {arXiv preprint arXiv:2504.09833},
year = {2025}
}