中文

S3K:基于多视角一致性的机器人操作自监督语义关键点

机器人学 2020-10-14 v2 计算机视觉与模式识别 机器学习

摘要

机器人的行动能力从根本上受其感知能力的制约。许多现有的视觉表征学习方法利用通用的训练准则,例如图像重建、潜空间平滑性或对控制的有用性,或者利用标注了特定特征(边界框、分割等)的大型数据集。然而,这两种方法往往难以捕捉特定物体上精密任务所需的精细细节,例如插头的抓取与对接。我们认为这些困难源于这些模型缺乏几何结构。在这项工作中,我们主张将语义 3D 关键点作为一种视觉表征,并提出了一种半监督训练目标,可使实例级或类别级关键点在极少监督下训练至 1-5 毫米精度。此外,与基于局部纹理的方法不同,我们的模型整合了来自大范围的上下文信息,因此对遮挡、噪声和缺乏可辨别纹理具有鲁棒性。我们展示了这种定位语义关键点的能力可实现人类可理解行为的高级脚本化。最后我们表明,这些关键点为强化学习提供了定义奖励函数的良好途径,并且是一种用于训练智能体的良好表征。

关键词

引用

@article{arxiv.2009.14711,
  title  = {S3K: Self-Supervised Semantic Keypoints for Robotic Manipulation via Multi-View Consistency},
  author = {Mel Vecerik and Jean-Baptiste Regli and Oleg Sushkov and David Barker and Rugile Pevceviciute and Thomas Rothörl and Christopher Schuster and Raia Hadsell and Lourdes Agapito and Jonathan Scholz},
  journal= {arXiv preprint arXiv:2009.14711},
  year   = {2020}
}

备注

11 pages, supplementary material available at: https://sites.google.com/view/2020-s3k/home