中文

好奇的机器人:通过物理交互学习视觉表征

计算机视觉与模式识别 2016-07-27 v2 人工智能 机器人学

摘要

训练视觉表征的正确监督信号是什么?计算机视觉中的当前方法使用来自ImageNet等数据集的类别标签来训练ConvNets。然而,对于生物代理而言,视觉表征学习不需要数百万个语义标签。我们认为,生物代理使用与世界的物理交互来学习视觉表征,这与仅使用被动观察(从网络下载的图像和视频)的当前视觉系统不同。例如,婴儿推物体、戳它们、将其放入口中并扔掉它们以学习表征。为此,我们在Baxter平台上构建了首批系统之一,该平台在桌面环境中推动、戳、抓取和观察物体。它使用四种不同类型的物理交互来收集超过130K个数据点,每个数据点为共享的ConvNet架构提供监督,使我们能够学习视觉表征。我们通过观察神经元激活和在该学习表征上执行最近邻检索来展示所学表征的质量。在数量上,我们在图像分类任务上评估我们学习的ConvNet,并显示出与不使用外部数据的学习相比的改进。最后,在实例检索任务上,我们的网络在recall@1上比ImageNet网络高出3%。

关键词

引用

@article{arxiv.1604.01360,
  title  = {The Curious Robot: Learning Visual Representations via Physical Interactions},
  author = {Lerrel Pinto and Dhiraj Gandhi and Yuanfeng Han and Yong-Lae Park and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1604.01360},
  year   = {2016}
}