中文

从经验与模仿中学习灵巧操控策略

机器学习 2016-11-17 v1 机器人学 系统与控制

摘要

我们探索了基于学习的方法,用于对执行非抓取式操控的灵巧五指手进行反馈控制。首先,我们学习能够在预定义初始状态下执行任务的局部控制器。这些控制器利用轨迹优化构建,优化基于直接从传感器数据学得的局部线性时变模型。在某些情况下,我们通过在虚拟环境中遥操作收集的人类演示来初始化优化器。我们证明,此类控制器能在仿真和物理平台上,针对围绕训练起始状态的有限初始条件范围,鲁棒地完成任务。随后,我们考虑了两种将控制器推广到更广泛初始条件的插值方法:深度学习和最近邻。我们发现最近邻方法取得了更高的性能。尽管如此,神经网络有其优势:它仅使用触觉和本体感觉反馈,无需关于物体的视觉反馈(即盲操作),并学习了一个时不变策略。相比之下,最近邻方法基于通过运动捕捉感知的初始物体状态的邻近程度,在不同的时变局部控制器之间切换。虽然两种泛化方法都有改进空间,但我们的工作表明:(i) 用于复杂非抓取式操控任务的基于局部轨迹的控制器,可以由惊人的少量训练数据构建;(ii) 此类控制器的集合可以被插值以形成更全局的控制器。结果总结在补充视频中:https://youtu.be/E0wmO6deqjo

关键词

引用

@article{arxiv.1611.05095,
  title  = {Learning Dexterous Manipulation Policies from Experience and Imitation},
  author = {Vikash Kumar and Abhishek Gupta and Emanuel Todorov and Sergey Levine},
  journal= {arXiv preprint arXiv:1611.05095},
  year   = {2016}
}

备注

Initial draft for a journal submission