V4D:用于视频级表征学习的 4D 卷积神经网络
计算机视觉与模式识别
2020-02-19 v1
摘要
现有多数用于视频表征学习的 3D CNN 是基于视频片段(clip)的方法,因而未考虑时空特征在视频级的时间演化。本文中,我们提出视频级 4D 卷积神经网络,称为 V4D,以通过 4D 卷积对长程时空表征的演化建模,同时借助残差连接保留强大的 3D 时空表征。具体而言,我们设计了一种能够捕获片段间交互的新 4D 残差块,可增强原始片段级 3D CNN 的表征能力。该 4D 残差块可轻松集成到现有 3D CNN 中,以分层方式进行长程建模。我们进一步给出了所提 V4D 的训练与推断方法。在三个视频识别基准上进行了大量实验,V4D 取得了优异结果,大幅超越近期 3D CNN。
引用
@article{arxiv.2002.07442,
title = {V4D:4D Convolutional Neural Networks for Video-level Representation Learning},
author = {Shiwen Zhang and Sheng Guo and Weilin Huang and Matthew R. Scott and Limin Wang},
journal= {arXiv preprint arXiv:2002.07442},
year = {2020}
}
备注
To appear in ICLR2020