中文

在卷积神经网络中从视频学习提取运动

计算机视觉与模式识别 2016-01-28 v1

摘要

本文展示了如何利用卷积神经网络(CNN)从视频中提取稠密光流。所提出的模型构成了更深架构的潜在构建模块,从而允许在不借助外部算法(例如用于视频识别)的情况下使用运动。我们从信号处理原理推导网络架构,以提供对图像对比度、相位和纹理所需的不变性。我们约束网络内的权重以强制严格的旋转不变性,并大幅减少需学习的参数数量。我们展示了仅在 Middlebury 数据集的 8 个序列上进行端到端训练,其数量比竞争的基于 CNN 的运动估计方法少几个数量级,并在 Middlebury 基准上获得与经典方法相当的性能。重要的是,我们的方法输出运动的分布式表示,允许表示多个透明运动和动态纹理。我们在网络设计和旋转不变性上的贡献提供了并非运动估计所特有的见解。

关键词

引用

@article{arxiv.1601.07532,
  title  = {Learning to Extract Motion from Videos in Convolutional Neural Networks},
  author = {Damien Teney and Martial Hebert},
  journal= {arXiv preprint arXiv:1601.07532},
  year   = {2016}
}