中文

不仅是奖励更是约束:在腿式机器人运动中的应用

机器人学 2024-07-23 v4 人工智能 机器学习

摘要

若干早期研究通过设计神经网络控制器并采用无模型强化学习训练,在复杂机器人系统中展现出令人印象深刻的控制性能。然而,这些具有自然运动风格和高任务性能的出色控制器是通过大量的奖励工程开发的,这是一个高度费力且耗时的过程,需要设计众多奖励项并确定合适的奖励系数。本工作中,我们提出一种新颖的强化学习框架,用于训练复杂机器人系统的神经网络控制器,该框架同时包含奖励与约束。为使工程师恰当地将意图反映到约束中并以最小计算开销处理约束,我们提出了两类约束类型与一种高效的策略优化算法。该学习框架被应用于训练具有不同形态与物理属性的若干腿式机器人的运动控制器,以穿越具有挑战性的地形。大量仿真与真实世界实验表明,通过仅调节单一奖励系数,即可以显著更少的奖励工程训练出高性能控制器。此外,得益于约束的可解释性与泛化能力,可采用更直接直观的工程流程。总结视频见 https://youtu.be/KAlm3yskhvM。

关键词

引用

@article{arxiv.2308.12517,
  title  = {Not Only Rewards But Also Constraints: Applications on Legged Robot Locomotion},
  author = {Yunho Kim and Hyunsik Oh and Jeonghyun Lee and Jinhyeok Choi and Gwanghyeon Ji and Moonkyu Jung and Donghoon Youm and Jemin Hwangbo},
  journal= {arXiv preprint arXiv:2308.12517},
  year   = {2024}
}

备注

Accepted to IEEE Transactions on Robotics (T-RO) 2024