中文

结合深度特征与拟合 Q 迭代学习视觉伺服

机器学习 2017-07-12 v2 人工智能 机器人学

摘要

视觉伺服涉及根据相机的观测选择移动机器人的动作,以达到世界中的目标位形。标准的视觉伺服方法通常依赖手动设计的特征和解析动力学模型,这限制了它们的泛化能力,并且通常需要大量针对特定应用的特征和模型工程。在这项工作中,我们研究如何将学习的视觉特征、学习的预测动力学模型和强化学习结合起来学习视觉伺服机制。我们专注于目标跟随,目标是设计能够使用少量相关目标数据学习视觉伺服的算法,以实现对新目标的快速适应。我们的方法基于在学习视觉特征空间中伺服相机,而不是图像像素或手动设计的特征点。我们证明,标准的深度特征(在我们的例子中取自为物体分类训练的模型)可以与双线性预测模型一起使用,以学习有效的视觉伺服,该伺服对视觉变化、视角和外观的变化以及遮挡具有鲁棒性。我们方法的一个关键组成部分是使用样本高效的拟合 Q 迭代算法来学习哪些特征最适合手头的任务。我们表明,在一个复杂的合成车辆跟随基准上,仅使用 20 个用于强化学习的训练轨迹样本即可学习有效的视觉伺服。我们展示了对基于图像像素或手动设计特征点的传统方法的实质性改进,并且我们展示了在样本效率上比标准无模型深度强化学习算法有两个数量级以上的提升。视频可在 http://rll.berkeley.edu/visual_servoing 获取。

关键词

引用

@article{arxiv.1703.11000,
  title  = {Learning Visual Servoing with Deep Features and Fitted Q-Iteration},
  author = {Alex X. Lee and Sergey Levine and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1703.11000},
  year   = {2017}
}

备注

ICLR 2017