中文

可扩展预测循环网络中基于连续视频的无监督学习

计算机视觉与模式识别 2016-10-03 v3

摘要

理解视觉现实涉及获取关于视觉世界中无数规律性的常识性知识,例如光照如何改变场景中物体的外观,以及运动如何改变它们表观的空间关系。这些规律性难以标注以训练有监督的机器学习算法;因此,算法需要以无监督的方式从现实世界中学习这些规律性。我们提出一种新颖的网络元架构,该架构能够从原始的连续视频中学习世界动力学。该网络的组件可以使用任何具备三种关键能力的算法来实现:随时间预测信号、降低信号维度(压缩),以及利用补充的上下文信息来辅助预测。所提出的架构具有高度并行化和可扩展性,并使用局部连接、处理和学习来实现。我们展示了该架构的一种实现,其中组件由多层感知器构建。我们应用该实现创建了一个系统,该系统能够对运动相机所见的物体进行稳定且鲁棒的视觉跟踪。结果显示其性能与最先进的跟踪算法相当或更优。该跟踪器可以在完全有监督或无监督-然后-短暂有监督两种模式下训练。短暂有监督模式的成功表明,模型的无监督部分提取了关于视觉现实的有用信息。这些结果暗示了一类新的人工智能算法,它们以独特的方式结合了预测和可扩展性,使其适合从现实世界中学习——并最终在现实世界中行动。

关键词

引用

@article{arxiv.1607.06854,
  title  = {Unsupervised Learning from Continuous Video in a Scalable Predictive Recurrent Network},
  author = {Filip Piekniewski and Patryk Laurent and Csaba Petre and Micah Richert and Dimitry Fisher and Todd Hylton},
  journal= {arXiv preprint arXiv:1607.06854},
  year   = {2016}
}

备注

38 pages, 20 figures, v3. Added several citations to relevant papers, expanded the discussion of existing approach in deep learning