中文

基于在线动力学适配与神经网络先验的操纵技能一次性学习

机器学习 2016-08-12 v3 机器人学

摘要

将强化学习应用于复杂机器人控制任务的关键挑战之一是需要收集大量经验以为手头任务找到有效策略。基于模型的强化学习能实现良好样本效率,但要求能够学习到足够好以学到有效策略的动力学模型。本工作中,我们开发了结合先前任务先验知识与动力学模型在线适配的基于模型的强化学习算法。这两个要素使得即使在真实动力学极难估计的情况下也能实现高样本效率学习,因为在线模型适配使方法能局部补偿动力学中未建模的变化。我们将先验经验编码为神经网络动力学模型,通过逐步修正动力学的局部线性模型进行在线适配,并利用模型预测控制在这些动力学下规划。实验结果表明,该方法可利用来自其他操纵行为的先验数据,仅尝试一次即解决多种复杂机器人操纵任务。

关键词

引用

@article{arxiv.1509.06841,
  title  = {One-Shot Learning of Manipulation Skills with Online Dynamics Adaptation and Neural Network Priors},
  author = {Justin Fu and Sergey Levine and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1509.06841},
  year   = {2016}
}