中文

基于强化学习的机器人控制中的非冲突能量最小化

机器人学 2025-09-03 v1

摘要

高效的机器人控制往往需要在任务性能与能耗之间进行权衡。强化学习 (RL) 中的常见方法是直接将能耗惩罚作为奖励函数的一部分。这需要精细调节权重项,以避免能量最小化损害任务成功的不良权衡。在本工作中,我们提出一种无超参数的梯度优化方法,以实现能耗最小化且不与任务性能冲突。灵感来源于多任务学习的最新研究成果,我们的方法对任务目标与能耗目标之间的策略梯度进行投影,从而推导出既能最小化能耗又不影响任务性能的策略更新。我们在 DM-Control 和 HumanoidBench 的标准 locomotion 基准测试中评估了该技术,展示了在保持可比任务性能的同时实现了 64% 的能耗降低。进一步,我们在 Unitree GO2 四足机器人上进行了能源高效策略的 Sim2Real 迁移实验。该方法在标准 RL 流水线中实现简单,需的代码改动最少,可适用于任何策略梯度方法,为能源高效控制策略提供了原则性的奖励塑形替代方案。

关键词

引用

@article{arxiv.2509.01765,
  title  = {Non-conflicting Energy Minimization in Reinforcement Learning based Robot Control},
  author = {Skand Peri and Akhil Perincherry and Bikram Pandit and Stefan Lee},
  journal= {arXiv preprint arXiv:2509.01765},
  year   = {2025}
}

备注

17 pages, 6 figures. Accepted as Oral presentation at Conference on Robot Learning (CoRL) 2025