中文

QT-Opt:用于基于视觉的机器人操作的 scalable 深度强化学习

机器学习 2018-11-29 v3 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

本文研究使用可扩展强化学习方法学习基于视觉的动态操作技能的问题。我们在抓取这一机器人操作长期挑战的背景下研究该问题。与选择抓取点然后执行所需抓取的静态学习行为不同,我们的方法支持闭环基于视觉的控制,即机器人根据最新观测持续更新其抓取策略以优化长时域抓取成功率。为此,我们引入 QT-Opt,一个可扩展的自监督基于视觉的强化学习框架,可利用超过 58 万次真实世界抓取尝试来训练具有超过 120 万参数的深度神经网络 Q 函数,以执行闭环真实世界抓取,对未见物体的泛化抓取成功率达 96%。除了获得极高的成功率外,我们的方法展现出与更标准抓取系统截然不同的行为:仅使用肩上式相机的 RGB 视觉感知,我们的方法自动学习重新抓取策略、试探物体以找到最有效抓取、学习重新定位物体并执行其他非预抓操作,以及对干扰和扰动动态响应。

关键词

引用

@article{arxiv.1806.10293,
  title  = {QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation},
  author = {Dmitry Kalashnikov and Alex Irpan and Peter Pastor and Julian Ibarz and Alexander Herzog and Eric Jang and Deirdre Quillen and Ethan Holly and Mrinal Kalakrishnan and Vincent Vanhoucke and Sergey Levine},
  journal= {arXiv preprint arXiv:1806.10293},
  year   = {2018}
}

备注

CoRL 2018 camera ready. 23 pages, 14 figures