自适应模仿:基于不可行参考的参数化双足行走深度强化学习
机器人学
2021-12-14 v2
摘要
直到最近,鲁棒的机器人 locomotion 才通过深度强化学习(DRL)得以实现。然而,对于参数化双足行走的高效学习,通常需要精心设计的参考动作,从而将性能限制在参考动作的水平。本文提出为参考动作的模仿学习设计一种自适应奖励函数。当智能体性能较低时,鼓励其模仿参考动作;而当其达到参考动作的极限时,则追求更高的性能。我们进一步证明,精心设计的参考动作可以用低质量参考动作替代——这些参考动作无需繁琐调参生成,且自身无法部署,只要它们能提供先验知识以加速学习过程即可。
引用
@article{arxiv.2112.03735,
title = {Adaptive Mimic: Deep Reinforcement Learning of Parameterized Bipedal Walking from Infeasible References},
author = {Chong Zhang and Qi Wu and Liqian Ma and Hongyuan Su},
journal= {arXiv preprint arXiv:2112.03735},
year = {2021}
}
备注
12pages, 9 figures (one added in v2). submitted to L4DC 2022