中文

StyleLoco:用于自然人类机器人 locomotion 的生成对抗蒸馏

机器人学 2025-03-20 v1 人工智能

摘要

人类机器人预计将在保证不同速度和地形下自然运动的同时获得广泛的 locomotion 能力。现有方法在学习人类 locomotion 时面临根本性困境:基于手工奖励的强化学习可实现敏捷 locomotion 但产生不自然的步态,而基于运动捕捉数据的生成对抗式仿射学习(GAIL)可产生自然运动,但 suffers from unstable training processes and restricted agility。由于专家策略与人类运动数据之间的内在异质性,这些方法的集成极具挑战性。为此,我们提出StyleLoco,一种通过生成对抗蒸馏(GAD)过程桥接这一鸿沟的新型两阶段框架。我们的框架首先使用强化学习训练教师策略以实现敏捷和动态的 locomotion。随后,采用多判别器架构,同时从教师策略和运动捕捉数据中提取技能。这一方法有效地将强化学习的敏捷性与人类运动的自然流畅性相结合,减轻了对抗训练常见的不稳定性问题。通过大量仿真和实际实验,我们展示StyleLoco使人类机器人能够执行多样化的 locomotion 任务,实现专家训练策略的精度和人类运动的自然美学,成功跨不同运动类型传递风格,同时在广泛命令输入下保持稳定的 locomotion。

关键词

引用

@article{arxiv.2503.15082,
  title  = {StyleLoco: Generative Adversarial Distillation for Natural Humanoid Robot Locomotion},
  author = {Le Ma and Ziyu Meng and Tengyu Liu and Yuhan Li and Ran Song and Wei Zhang and Siyuan Huang},
  journal= {arXiv preprint arXiv:2503.15082},
  year   = {2025}
}

备注

9 pages, 4 figures