中文

面向稳健人形机器人站立与行走的奖励函数设计与评估

机器人学 2024-09-02 v2

摘要

人形机器人必须具备在自然扰动作用下仍能站立和行走的能力。近期通过仿真到现实的强化学习 (RL) 训练获得此类运动控制器的进展日益显现,不同方法主要区别在于其奖励函数设计。然而,既有工作缺乏系统性方法来测试新奖励函数并通过可重复实验比较控制器性能。这限制了我们对不同方法之间权衡的理解,阻碍了进一步发展。为此,我们提出一种低成本、定量的基准测试方法,用于评估和比较站立与行走 (SaW) 控制器在命令跟随、扰动恢复和能源效率等指标上的实际性能。我们也重新审视奖励函数设计,构建一种最小约束的奖励函数以训练 SaW 控制器。我们实验验证了该基准框架可识别改进领域,这些改进可被系统性地加以解决以提升策略性能。我们还将新的控制器与 Digit 人形机器人上的 SOTA 控制器进行比较。结果在控制器之间提供了清晰的定量权衡,并指明了未来改进奖励函数和扩展基准测试的方向。

关键词

引用

@article{arxiv.2404.19173,
  title  = {Revisiting Reward Design and Evaluation for Robust Humanoid Standing and Walking},
  author = {Bart van Marum and Aayam Shrestha and Helei Duan and Pranay Dugar and Jeremy Dao and Alan Fern},
  journal= {arXiv preprint arXiv:2404.19173},
  year   = {2024}
}

备注

8 pages, 5 figs