中文

从带解说指令视频中进行无监督学习

计算机视觉与模式识别 2016-06-29 v4 机器学习

摘要

我们解决从一组带解说的指令视频中自动学习完成某项任务(如更换汽车轮胎)的主要步骤的问题。本文的贡献有三方面。首先,我们开发了一种新的无监督学习方法,利用输入视频与相关解说的互补性质。该方法解决两个聚类问题,一个在文本中,一个在视频中,依次应用并通过联合约束连接,以在两种模态中获得单一的连贯步骤序列。其次,我们收集并标注了一个来自互联网的新的具有挑战性的真实世界指令视频数据集。该数据集包含约800,000帧,对应五种不同的任务,包含人与物体之间的复杂交互,并在各种室内外环境中捕获。第三,我们通过实验证明,所提方法能以无监督方式自动发现实现任务的主要步骤,并在输入视频中定位这些步骤。

关键词

引用

@article{arxiv.1506.09215,
  title  = {Unsupervised Learning from Narrated Instruction Videos},
  author = {Jean-Baptiste Alayrac and Piotr Bojanowski and Nishant Agrawal and Josef Sivic and Ivan Laptev and Simon Lacoste-Julien},
  journal= {arXiv preprint arXiv:1506.09215},
  year   = {2016}
}

备注

Appears in: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2016). 21 pages