中文

通过近端策略优化学习人形机器人跑步技能

机器人学 2019-10-24 v1 人工智能 机器学习

摘要

在 Soccer 3D 当前的演进水平上,运动控制是团队表现的关键因素。近期工作利用基于机器学习的无模型方法来发掘机器人动力学以获得更快的 locomotion 技能,实现了跑步策略,从而在 Soccer 3D 环境中开辟了新的研究方向。在本工作中,我们提出了一种基于深度强化学习的方法,该方法在没有任何先验知识的情况下学习跑步技能,使用一个输入与机器人动力学相关的神经网络。我们的结果以显著优势超越了 Soccer 3D 文献中先前报道的 SOTA 冲刺速度。它还展示了样本效率的提升,能够在短短几小时内学会跑步。我们通过分析训练过程以及从速度、可靠性和类人相似度方面评估策略来报告结果。最后,我们提出了使我们得以改进先前结果的关键因素,并分享了一些未来工作的想法。

关键词

引用

@article{arxiv.1910.10620,
  title  = {Learning Humanoid Robot Running Skills through Proximal Policy Optimization},
  author = {Luckeciano C. Melo and Marcos R. O. A. Maximo},
  journal= {arXiv preprint arXiv:1910.10620},
  year   = {2019}
}