中文

通过 Lipschitz 约束策略学习平滑的人形机器人运动

机器人学 2024-10-29 v3 人工智能

摘要

强化学习结合仿真到现实迁移为开发腿式机器人的运动控制器提供了一个通用框架。为了促进在现实世界中的成功部署,通常采用平滑技术,例如低通滤波器和平滑奖励,来开发具有平滑行为的策略。然而,由于这些技术是不可微的,并且通常需要对大量超参数进行繁琐的调整,因此它们往往需要为每个机器人平台进行大量的手动调整。为了应对这一挑战并建立一种强制执行平滑行为的通用技术,我们提出了一种简单有效的方法,即对学习到的策略施加 Lipschitz 约束,我们称之为 Lipschitz 约束策略(LCP)。我们表明,Lipschitz 约束可以以梯度惩罚的形式实现,这提供了一个可微的目标,可以很容易地与自动微分框架结合。我们证明,LCP 有效地取代了对平滑奖励或低通滤波器的需求,并且可以轻松集成到许多不同人形机器人的训练框架中。我们在仿真和真实世界的人形机器人上广泛评估了 LCP,产生了平滑且鲁棒的运动控制器。所有仿真和部署代码以及完整的检查点均可在我们的项目页面上获取:https://lipschitz-constrained-policy.github.io。

关键词

引用

@article{arxiv.2410.11825,
  title  = {Learning Smooth Humanoid Locomotion through Lipschitz-Constrained Policies},
  author = {Zixuan Chen and Xialin He and Yen-Jen Wang and Qiayuan Liao and Yanjie Ze and Zhongyu Li and S. Shankar Sastry and Jiajun Wu and Koushil Sreenath and Saurabh Gupta and Xue Bin Peng},
  journal= {arXiv preprint arXiv:2410.11825},
  year   = {2024}
}

备注

8 pages