用于基于模型深度强化学习与无模型微调的神经网络动力学
机器学习
2017-12-05 v2 人工智能
机器人学
摘要
无模型深度强化学习算法已被证明能够学习广泛的机器人技能,但通常需要大量样本才能实现良好的性能。原则上,基于模型的算法可以提供更高效的学习,但已被证明难以扩展至诸如深度神经网络等富有表达力的高容量模型。在本工作中,我们证明了中等规模的神经网络模型实际上可以与模型预测控制(MPC)相结合,在基于模型的强化学习算法中实现极佳的样本复杂度,产生稳定且合理的步态以完成各种复杂的运动任务。我们还提出使用深度神经网络动力学模型来初始化无模型学习器,以将基于模型方法的样本效率与无模型方法的高任务特定性能相结合。我们在MuJoCo运动任务上实证表明,我们仅基于随机动作数据训练的纯基于模型方法能够以极佳的样本效率跟踪任意轨迹,并且我们的混合算法可以加速高速基准测试任务上的无模型学习,在swimmer、cheetah、hopper和ant智能体上实现了3至5倍的样本效率提升。视频可在 https://sites.google.com/view/mbmf 找到。
引用
@article{arxiv.1708.02596,
title = {Neural Network Dynamics for Model-Based Deep Reinforcement Learning with Model-Free Fine-Tuning},
author = {Anusha Nagabandi and Gregory Kahn and Ronald S. Fearing and Sergey Levine},
journal= {arXiv preprint arXiv:1708.02596},
year = {2017}
}