STH:用于高效动作识别的时空混合卷积
计算机视觉与模式识别
2020-03-19 v1
摘要
有效且高效的时空建模对动作识别至关重要。现有方法受限于模型性能与模型复杂度之间的权衡。本文中,我们提出一种新颖的时空混合卷积网络(记为“STH”),它以较小的参数代价同时编码空间与时间视频信息。不同于现有工作用不同卷积层顺序或并行提取空间与时间信息,我们将输入通道分为多组,并在一个卷积层内交错空间与时间操作,从而深度融合并入空间与时间线索。此类设计实现了高效的时空建模并保持了较小的模型规模。STH-Conv 是一种通用构建块,可通过替换常规 2D-Conv 块(2D 卷积)插入现有 2D CNN 架构如 ResNet 和 MobileNet 中。STH 网络在 Something-Something(V1 与 V2)、Jester 和 HMDB-51 等基准数据集上取得了与其竞争者相当甚至更优的性能。此外,STH 在保持甚至小于 2D CNNs 的参数代价的同时,享有优于 3D CNNs 的性能。
引用
@article{arxiv.2003.08042,
title = {STH: Spatio-Temporal Hybrid Convolution for Efficient Action Recognition},
author = {Xu Li and Jingwen Wang and Lin Ma and Kaihao Zhang and Fengzong Lian and Zhanhui Kang and Jinjun Wang},
journal= {arXiv preprint arXiv:2003.08042},
year = {2020}
}