中文

从第一人称视频中无监督学习重要物体

计算机视觉与模式识别 2017-08-03 v3

摘要

置于人头部的主观视角相机能够捕捉到哪些物体对佩戴者而言是重要的。先前针对此任务的大多数方法,以监督学习的方式从人工标注的第一人称数据中学习检测此类重要物体。然而,重要物体与相机佩戴者的内部状态(如其意图和注意力)紧密相关,因此只有佩戴相机的人才能提供重要性标签。这种限制使得标注过程成本高昂且可扩展性有限。在这项工作中,我们展示了无需相机佩戴者甚至第三方标注者的监督,即可在第一人称图像中检测重要物体。我们将重要物体检测问题形式化为 1) 分割智能体与 2) 识别智能体之间的相互作用。分割智能体首先为每张图像提出一个可能的重要物体分割掩码,然后将其馈送给识别智能体,后者学习利用视觉语义和空间特征来预测重要物体掩码。我们通过所提出的视觉-空间网络(VSN)内部的交替交叉通路监督方案来实现两个智能体之间的这种相互作用。我们的 VSN 由空间(“何处”)通路和视觉(“什么”)通路组成,其中一条通路学习通用的视觉语义,而另一条则专注于空间位置线索。我们的无监督学习通过交叉通路监督完成,即一条通路将其预测结果馈送给一个分割智能体,该智能体提出一个候选重要物体分割掩码,随后被另一条通路用作监督信号。我们在两个不同的重要物体数据集上展示了我们方法的成功,其取得了与监督方法相似或更好的结果。

关键词

引用

@article{arxiv.1611.05335,
  title  = {Unsupervised Learning of Important Objects from First-Person Videos},
  author = {Gedas Bertasius and Hyun Soo Park and Stella X. Yu and Jianbo Shi},
  journal= {arXiv preprint arXiv:1611.05335},
  year   = {2017}
}