中文

STH:用于高效动作识别的时空混合卷积

计算机视觉与模式识别 2020-03-19 v1

摘要

有效且高效的时空建模对动作识别至关重要。现有方法受限于模型性能与模型复杂度之间的权衡。本文中,我们提出一种新颖的时空混合卷积网络(记为“STH”),它以较小的参数代价同时编码空间与时间视频信息。不同于现有工作用不同卷积层顺序或并行提取空间与时间信息,我们将输入通道分为多组,并在一个卷积层内交错空间与时间操作,从而深度融合并入空间与时间线索。此类设计实现了高效的时空建模并保持了较小的模型规模。STH-Conv 是一种通用构建块,可通过替换常规 2D-Conv 块(2D 卷积)插入现有 2D CNN 架构如 ResNet 和 MobileNet 中。STH 网络在 Something-Something(V1 与 V2)、Jester 和 HMDB-51 等基准数据集上取得了与其竞争者相当甚至更优的性能。此外,STH 在保持甚至小于 2D CNNs 的参数代价的同时,享有优于 3D CNNs 的性能。

关键词

引用

@article{arxiv.2003.08042,
  title  = {STH: Spatio-Temporal Hybrid Convolution for Efficient Action Recognition},
  author = {Xu Li and Jingwen Wang and Lin Ma and Kaihao Zhang and Fengzong Lian and Zhanhui Kang and Jinjun Wang},
  journal= {arXiv preprint arXiv:2003.08042},
  year   = {2020}
}