15分钟内学习仿真-真实人类oid locomotion
机器人学
2025-12-02 v1 人工智能
机器学习
摘要
大规模并行仿真已将机器人强化学习训练时间从天数缩短到分钟。然而,实现快速可靠的仿真-真实人类oid locomotion 仍然困难,因为面临诸多挑战,如高维度和域随机化。在本工作中,我们引入一种简单实用的配方,基于off-policy RL算法,即FastSAC和FastTD3,使人类oid locomotion 策略仅需15分钟即可在单张RTX 4090 GPU上训练。我们的简单配方通过精心调整的设计选择和简约奖励函数,在数千个并行环境中稳定off-policy RL算法。我们展示了在强大的域随机化条件下(包括随机化动力学、粗糙地形和推力扰动),以及在Unitree G1和Booster T1机器人上快速训练全身人类动作跟踪策略。我们提供视频和开源实现,链接为:https://younggyo.me/fastsac-humanoid。
引用
@article{arxiv.2512.01996,
title = {Learning Sim-to-Real Humanoid Locomotion in 15 Minutes},
author = {Younggyo Seo and Carmelo Sferrazza and Juyue Chen and Guanya Shi and Rocky Duan and Pieter Abbeel},
journal= {arXiv preprint arXiv:2512.01996},
year = {2025}
}
备注
Project website: https://younggyo.me/fastsac-humanoid