中文

利用大规模并行深度强化学习在数分钟内学会行走

机器人学 2022-08-22 v3 机器学习

摘要

在本工作中,我们提出并研究了一种训练设置,其通过在单台工作站 GPU 上使用大规模并行,实现对真实世界机器人任务的快速策略生成。我们分析并讨论了在大规模并行机制下不同训练算法组件对最终策略性能与训练时间的影响。此外,我们提出了一种新颖的受游戏启发的课程,非常适合于以数千个并行模拟机器人进行训练。我们通过训练四足机器人 ANYmal 在具有挑战性的地形上行走来评估该方法。该并行方法允许在不到四分钟内训练出平坦地形策略,而在二十分钟内训练出不平坦地形策略。这代表了相较先前工作多个数量级的加速。最后,我们将策略迁移到真实机器人以验证该方法。我们开源了我们的训练代码,以帮助加速习得式腿式运动领域的进一步研究。

关键词

引用

@article{arxiv.2109.11978,
  title  = {Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning},
  author = {Nikita Rudin and David Hoeller and Philipp Reist and Marco Hutter},
  journal= {arXiv preprint arXiv:2109.11978},
  year   = {2022}
}

备注

CoRL 2021 Project website: : https://leggedrobotics.github.io/legged_gym/ Video: https://youtu.be/8sO7VS3q8d0