中文

用于因果 3D CNN 的循环卷积

计算机视觉与模式识别 2019-09-04 v2 机器学习

摘要

近来,三维(3D)卷积神经网络(CNN)通过在已有的 2D CNN 上增加第三维即时间维,已成为捕获视频中时空表示的主流方法。然而,此类 3D CNN 是反因果的(即它们利用过去与未来帧的信息来产生特征表示,从而阻碍其在在线场景中的使用),将时间推理范围限制于时间卷积核的大小,并且对于视频序列到序列建模(例如动作检测中)不能保持时间分辨率。为应对这些严重局限,我们提出一种新的用于视频因果/在线处理的 3D CNN 架构。具体而言,我们提出一种新颖的循环卷积网络(RCN),其依靠循环在每个网络层级捕获跨帧的时间上下文。我们的网络将 3D 卷积分解为(1)一个 2D 空间卷积分量,以及(2)一个额外的隐状态 1×11\times 1 卷积,应用于时间上。任意时刻 tt 的隐状态被假定依赖于 t1t-1 时刻的隐状态与当前空间卷积分量的输出。因此,所提网络:(i)产生因果输出,(ii)提供灵活的时间推理,(iii)保持时间分辨率。我们在大规模 Kinetics 与 MultiThumos 数据集上的实验表明,所提方法与反因果 3D CNN 性能相当,同时具有因果性且使用更少参数。

关键词

引用

@article{arxiv.1811.07157,
  title  = {Recurrent Convolutions for Causal 3D CNNs},
  author = {Gurkirt Singh and Fabio Cuzzolin},
  journal= {arXiv preprint arXiv:1811.07157},
  year   = {2019}
}

备注

Workshop on Large Scale Holistic Video Understanding, ICCVW, 2019