中文

V4D:用于视频级表征学习的 4D 卷积神经网络

计算机视觉与模式识别 2020-02-19 v1

摘要

现有多数用于视频表征学习的 3D CNN 是基于视频片段(clip)的方法,因而未考虑时空特征在视频级的时间演化。本文中,我们提出视频级 4D 卷积神经网络,称为 V4D,以通过 4D 卷积对长程时空表征的演化建模,同时借助残差连接保留强大的 3D 时空表征。具体而言,我们设计了一种能够捕获片段间交互的新 4D 残差块,可增强原始片段级 3D CNN 的表征能力。该 4D 残差块可轻松集成到现有 3D CNN 中,以分层方式进行长程建模。我们进一步给出了所提 V4D 的训练与推断方法。在三个视频识别基准上进行了大量实验,V4D 取得了优异结果,大幅超越近期 3D CNN。

关键词

引用

@article{arxiv.2002.07442,
  title  = {V4D:4D Convolutional Neural Networks for Video-level Representation Learning},
  author = {Shiwen Zhang and Sheng Guo and Weilin Huang and Matthew R. Scott and Limin Wang},
  journal= {arXiv preprint arXiv:2002.07442},
  year   = {2020}
}

备注

To appear in ICLR2020