中文

面向高效视频分类的多样性时间聚合与深度可分离时空分解

计算机视觉与模式识别 2021-04-23 v3

摘要

近期备受关注的视频分类研究集中于时间建模与 3D 高效架构领域。然而,时间建模方法效率不高,或 3D 高效架构对时间建模关注不足。为弥合二者差距,我们提出一种高效时间建模的 3D 架构 VoV3D,其由时间一次性聚合(T-OSA)模块与深度可分离分解组件 D(2+1)D 构成。T-OSA 旨在通过聚合具有不同时序感受野的时间特征来构建特征层次。堆叠该 T-OSA 使网络自身能够跨帧建模短程与长程时间关系,无需任何外部模块。受核分解与通道分解启发,我们还设计了名为 D(2+1)D 的深度可分离时空分解模块,将 3D 深度可分离卷积分解为两个空间与时间深度可分离卷积,以使网络更轻量高效。利用所提时间建模方法(T-OSA)与高效分解组件(D(2+1)D),我们构建了两类 VoV3D 网络:VoV3D-M 与 VoV3D-L。得益于其时间建模的效率与有效性,VoV3D-L 的模型参数量减少 6 倍、计算量降低 16 倍,在 Something-Something 与 Kinetics-400 上均超越了一种最先进的时间建模方法。此外,VoV3D 展现出优于具有相近模型容量的先进高效 3D 架构 X3D 的时间建模能力。我们希望 VoV3D 可作为高效视频分类的基线。

关键词

引用

@article{arxiv.2012.00317,
  title  = {Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification},
  author = {Youngwan Lee and Hyung-Il Kim and Kimin Yun and Jinyoung Moon},
  journal= {arXiv preprint arXiv:2012.00317},
  year   = {2021}
}