中文

模拟器预测控制:利用习得任务表示与 MPC 实现零样本泛化与序列化

机器人学 2021-01-29 v3 人工智能 机器学习 机器学习

摘要

仿真到实物的迁移是使强化学习在真实机器人上实用化的重要策略。成功的 sim-to-real 迁移系统难以产生跨任务泛化的策略,尽管其训练时长相当于数千小时真实机器人时间。为弥补这一不足,我们提出一种基于模型预测控制(MPC)与任务表示学习算法、在真实机器人上高效学习新技能的新方法。简而言之,我们展示了如何将 sim-to-real 方法预训练阶段的仿真复用为前瞻工具,使 sim-to-real 策略适应未见过任务。我们并非端到端学习单任务策略并尝试迁移,而是首先利用仿真同时学习(1)任务适宜基本技能的连续参数化(即技能嵌入或隐变量),以及(2)以该表示为条件的单一多技能策略。随后我们将多技能策略直接迁移至真实机器人,并通过选择驱动该策略的技能隐变量序列来驱动机器人,每个隐变量对应一个预习得的基本技能控制器。我们利用 MPC 选择新的技能隐变量序列来控制机器人以完成未见任务,其中 MPC 模型由在仿真环境中执行的预训练技能策略构成,并与真实机器人并行运行。我们讨论了该方法的背景与原理,详述了其实际实现,并通过使用我们的方法训练真实 Sawyer 机器人完成绘图与推块等运动任务来评估其性能。

关键词

引用

@article{arxiv.1810.02422,
  title  = {Simulator Predictive Control: Using Learned Task Representations and MPC for Zero-Shot Generalization and Sequencing},
  author = {Zhanpeng He and Ryan Julian and Eric Heiden and Hejia Zhang and Stefan Schaal and Joseph J. Lim and Gaurav Sukhatme and Karol Hausman},
  journal= {arXiv preprint arXiv:1810.02422},
  year   = {2021}
}

备注

Presented at NeurIPS 2018 Workshop: Deep Reinforcement Learning. See https://youtu.be/te4JWe7LPKw for supplemental video