中文

Learning to Run 挑战赛解决方案:将强化学习方法适配于神经肌肉骨骼环境

机器学习 2018-04-03 v1 人工智能 机器学习

摘要

在 NIPS 2017 Learning to Run 挑战赛中,参与者的任务是为肌肉骨骼模型构建控制器,使其尽可能快地通过障碍赛道。排名靠前的参与者受邀描述他们的算法。在这项工作中,我们展示了八种使用深度强化学习方法的解决方案,这些方法基于深度确定性策略梯度(Deep Deterministic Policy Gradient)、近端策略优化(Proximal Policy Optimization)和信赖域策略优化(Trust Region Policy Optimization)等算法。许多解决方案使用了类似的松弛与启发式方法,例如奖励塑形、帧跳过、动作空间离散化、对称性和策略混合。然而,这八个团队各自对已知算法进行了不同的修改。

关键词

引用

@article{arxiv.1804.00361,
  title  = {Learning to Run challenge solutions: Adapting reinforcement learning methods for neuromusculoskeletal environments},
  author = {Łukasz Kidziński and Sharada Prasanna Mohanty and Carmichael Ong and Zhewei Huang and Shuchang Zhou and Anton Pechenko and Adam Stelmaszczyk and Piotr Jarosik and Mikhail Pavlov and Sergey Kolesnikov and Sergey Plis and Zhibo Chen and Zhizheng Zhang and Jiale Chen and Jun Shi and Zhuobin Zheng and Chun Yuan and Zhihui Lin and Henryk Michalewski and Piotr Miłoś and Błażej Osiński and Andrew Melnik and Malte Schilling and Helge Ritter and Sean Carroll and Jennifer Hicks and Sergey Levine and Marcel Salathé and Scott Delp},
  journal= {arXiv preprint arXiv:1804.00361},
  year   = {2018}
}

备注

27 pages, 17 figures