中文

基于能源约束的强化学习人oid 步行优化——ECO 方法

机器人学 2026-02-09 v1

摘要

实现稳定且高效的 locomotion 对人oid 机器人在实际应用中持续运行至关重要。现有 MPC 和强化学习方法通常依赖于嵌入多目标优化框架中的能源相关指标,需要大量超参数调优,常导致次优策略。为此,我们提出了 ECO(Energy-Constrained Optimization),一种约束型强化学习框架,将能源相关指标从奖励中分离,重新定义为显式的不等式约束。该方法提供了清晰且可解释的能源成本物理表征,使能源效率的超参数调优更高效且直观。ECO 引入针对能源消耗和参考运动的专用约束,通过拉格朗日方法实现稳定、对称且高效的人oid 步行。我们将 ECO 与 MPC、基于奖励塑形的标准强化学习以及四种最新约束强化学习方法进行评估。包括仿真内仿真和仿真到真实转移在内的实验表明,ECO 在保持稳健步行性能的同时,显著降低了能源消耗。这些结果标志着人oid locomotion 能源效率的重大进展。所有实验演示均可在项目网站 https://sites.google.com/view/eco-humanoid 查阅。

关键词

引用

@article{arxiv.2602.06445,
  title  = {ECO: Energy-Constrained Optimization with Reinforcement Learning for Humanoid Walking},
  author = {Weidong Huang and Jingwen Zhang and Jiongye Li and Shibowen Zhang and Jiayang Wu and Jiayi Wang and Hangxin Liu and Yaodong Yang and Yao Su},
  journal= {arXiv preprint arXiv:2602.06445},
  year   = {2026}
}

备注

IEEE TRANSACTIONS ON AUTOMATION SCIENCE AND ENGINEERING. PREPRINT VERSION. ACCEPTED FEB, 2026