中文

时序三维卷积网络:用于视频分类的新架构与迁移学习

计算机视觉与模式识别 2017-11-23 v1

摘要

本文工作的驱动力在于如何充分利用视频中可用的时间线索以实现准确分类,尤其是人体动作识别?迄今为止,视觉界主要关注具有固定时间卷积核深度的时空方法。我们引入了一种新的时间层,其对可变时间卷积核深度进行建模。我们将这一新时间层嵌入到我们提出的三维 CNN 中。我们用三维滤波器和池化核扩展了通常二维的 DenseNet 架构。我们将我们提出的视频卷积网络命名为“时序三维卷积网络”(Temporal 3D ConvNet, T3D),并将其新时间层命名为“时间转移层”(Temporal Transition Layer, TTL)。我们的实验表明,T3D 在 HMDB51、UCF101 和 Kinetics 数据集上优于当前最先进的方法。训练三维 ConvNet 的另一个问题是关于从零开始用海量标注数据集训练以获得合理性能,因此从二维 ConvNet 中学到的知识被完全忽略。本工作的另一贡献是一种简单而有效的技术,用于将预训练的二维 CNN 的知识迁移到随机初始化的三维 CNN 以实现稳定的权重初始化。这使我们能够显著减少三维 CNN 所需的训练样本数量。因此,通过对该网络进行微调,我们击败了在大型视频数据集(如 Sports-1M)上训练并已在目标数据集(如 HMDB51/UCF101)上微调的通用及近期三维 CNN 方法的性能。T3D 代码将会发布。

关键词

引用

@article{arxiv.1711.08200,
  title  = {Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification},
  author = {Ali Diba and Mohsen Fayyaz and Vivek Sharma and Amir Hossein Karami and Mohammad Mahdi Arzani and Rahman Yousefzadeh and Luc Van Gool},
  journal= {arXiv preprint arXiv:1711.08200},
  year   = {2017}
}