中文

将运动规划器增强策略蒸馏为用于机器人操作的视觉控制策略

机器学习 2021-11-12 v1 人工智能 机器人学

摘要

在真实、有障碍的环境中学习复杂操作任务是一个具有挑战性的问题,其原因在于障碍物存在下的困难探索以及高维视觉观测。先前工作通过结合运动规划与强化学习来解决探索问题。然而,运动规划器增强策略需要访问状态信息,而这在真实世界环境中通常不可用。为此,我们提出通过以下方式将基于状态的 motion planner augmented policy 蒸馏为视觉控制策略:(1) 视觉行为克隆以消除运动规划器依赖及其抖动运动;(2) 以行为克隆智能体平滑轨迹为指导的基于视觉的强化学习。我们在有障碍环境中的三个操作任务上评估了我们的方法,并与各类强化学习和模仿学习基线进行比较。结果表明我们的框架具有极高的样本效率,且优于最先进的算法。此外,结合域随机化,我们的策略能够实现向带有干扰物的未知环境设置的零样本迁移。代码与视频见 https://clvrai.com/mopa-pd

关键词

引用

@article{arxiv.2111.06383,
  title  = {Distilling Motion Planner Augmented Policies into Visual Control Policies for Robot Manipulation},
  author = {I-Chun Arthur Liu and Shagun Uppal and Gaurav S. Sukhatme and Joseph J. Lim and Peter Englert and Youngwoon Lee},
  journal= {arXiv preprint arXiv:2111.06383},
  year   = {2021}
}

备注

Published at the Conference on Robot Learning (CoRL) 2021