中文

时间对比网络:从视频中进行自监督学习

计算机视觉与模式识别 2018-03-21 v3 机器人学

摘要

我们提出一种自监督方法,完全从未标注的多视角视频中学习表征和机器人行为,并研究该表征如何用于两种机器人模仿设置:模仿人类物体交互视频,以及模仿人体姿态。人类行为模仿需要视角不变的表征,捕捉末端执行器(手或机器人夹爪)与环境、物体属性和身体姿态之间的关系。我们使用度量学习损失训练表征,其中同一观测的多个同时视角在嵌入空间中被吸引,同时被与时间邻居排斥,时间邻居通常视觉相似但功能不同。换言之,模型同时学习识别不同外观图像间的共性,以及相似外观图像间的差异。该信号使我们的模型发现跨视角不变但跨时间变化的属性,同时忽略遮挡、运动模糊、光照和背景等干扰变量。我们证明该表征可被机器人用于直接模仿人体姿态而无需显式对应,并可用作强化学习算法中的奖励函数。虽然表征从未标注的任务相关视频集合中学习,但机器人行为如倒水是通过观看人类单个第三人称演示学习的。在所学表征下遵循人类演示获得的奖励函数实现了高效的强化学习,适用于真实世界机器人系统。视频结果、开源代码和数据集可在 https://sermanet.github.io/imitate 获取。

关键词

引用

@article{arxiv.1704.06888,
  title  = {Time-Contrastive Networks: Self-Supervised Learning from Video},
  author = {Pierre Sermanet and Corey Lynch and Yevgen Chebotar and Jasmine Hsu and Eric Jang and Stefan Schaal and Sergey Levine},
  journal= {arXiv preprint arXiv:1704.06888},
  year   = {2018}
}