中文

从无标签视频中预测视觉表示

计算机视觉与模式识别 2016-12-01 v2

摘要

在计算机视觉中,在动作和物体开始或出现之前对其加以预测是一个困难问题,具有若干现实应用。该任务具有挑战性部分是因为它需要利用难以写下的广泛世界知识。我们认为,高效学习此类知识的一个有前景的资源是现成可用的无标签视频。我们提出一个利用无标签视频中的时间结构来学习预测人类动作和物体的框架。我们方法背后的关键思想是,我们可以训练深度网络预测未来图像的视觉表示。视觉表示是一种有前景的预测目标,因为它们在比像素更高的语义层级上编码图像,且自动可计算。然后我们将识别算法应用于我们的预测表示以预测物体和动作。我们在两个数据集上实验验证了该想法,预测未来一秒的动作和未来五秒的物体。

关键词

引用

@article{arxiv.1504.08023,
  title  = {Anticipating Visual Representations from Unlabeled Video},
  author = {Carl Vondrick and Hamed Pirsiavash and Antonio Torralba},
  journal= {arXiv preprint arXiv:1504.08023},
  year   = {2016}
}

备注

CVPR 2016