中文

自适应模仿:基于不可行参考的参数化双足行走深度强化学习

机器人学 2021-12-14 v2

摘要

直到最近,鲁棒的机器人 locomotion 才通过深度强化学习(DRL)得以实现。然而,对于参数化双足行走的高效学习,通常需要精心设计的参考动作,从而将性能限制在参考动作的水平。本文提出为参考动作的模仿学习设计一种自适应奖励函数。当智能体性能较低时,鼓励其模仿参考动作;而当其达到参考动作的极限时,则追求更高的性能。我们进一步证明,精心设计的参考动作可以用低质量参考动作替代——这些参考动作无需繁琐调参生成,且自身无法部署,只要它们能提供先验知识以加速学习过程即可。

关键词

引用

@article{arxiv.2112.03735,
  title  = {Adaptive Mimic: Deep Reinforcement Learning of Parameterized Bipedal Walking from Infeasible References},
  author = {Chong Zhang and Qi Wu and Liqian Ma and Hongyuan Su},
  journal= {arXiv preprint arXiv:2112.03735},
  year   = {2021}
}

备注

12pages, 9 figures (one added in v2). submitted to L4DC 2022