利用视频混洗网络学习高效视频表示
计算机视觉与模式识别
2019-11-27 v1
摘要
3D CNN 在近期视频识别任务中展现出学习时空表示的强大能力。然而,将 2D 卷积膨胀为 3D 不可避免地引入额外计算开销,使其在实际部署中 cumbersome。我们思考是否存在一种方法,使常规 2D 卷积具备时间视觉能力而无需扩展其核。为此,我们提出视频混洗,一种无参数的插件组件,可高效重分配 2D 卷积的输入,从而将其感受野扩展至时间维度。实际上,视频混洗首先将每帧特征划分为多个组,随后通过时间混洗操作聚合分组特征。这使得后续的 2D 卷积能够聚合全局时空特征。所提出的视频混洗可灵活插入流行的 2D CNN 中,形成视频混洗网络(VSN)。凭借简单而高效的实现,VSN 在时间建模基准上表现惊人地好。实验中,VSN 不仅在 Kinetics 与 Moments in Time 上获得非平凡提升,还在 Something-Something-V1、Something-Something-V2 数据集上取得最先进性能。
引用
@article{arxiv.1911.11319,
title = {Learning Efficient Video Representation with Video Shuffle Networks},
author = {Pingchuan Ma and Yao Zhou and Yu Lu and Wei Zhang},
journal= {arXiv preprint arXiv:1911.11319},
year = {2019}
}