中文

推断与适配:基于逆强化学习从演示中学习双足运动奖励

机器人学 2023-09-29 v1 机器学习

摘要

使双足行走机器人学会如何在高度不平、动态变化的地形上机动具有挑战性,这源于机器人动力学与交互环境的复杂性。近期从演示中学习的进展在复杂环境中的机器人学习上展现出有前景的结果。虽然专家策略的模仿学习已被充分探索,但学习专家奖励函数的研究在足式运动领域很大程度上未被充分探索。本文将最先进的逆强化学习(IRL)技术引入解决复杂地形上的双足运动问题。我们提出学习专家奖励函数的算法,并随后分析所学函数。通过非线性函数逼近,我们揭示了专家运动策略中有意义的洞见。此外,我们经实验证明,用推断的奖励函数训练双足运动策略可提升其在未见地形上的行走表现,凸显了奖励学习所提供的适应性。

关键词

引用

@article{arxiv.2309.16074,
  title  = {Infer and Adapt: Bipedal Locomotion Reward Learning from Demonstrations via Inverse Reinforcement Learning},
  author = {Feiyang Wu and Zhaoyuan Gu and Hanran Wu and Anqi Wu and Ye Zhao},
  journal= {arXiv preprint arXiv:2309.16074},
  year   = {2023}
}