中文

用于人体动作识别的逐通道时空 STFT 卷积神经网络

计算机视觉与模式识别 2021-05-05 v1

摘要

传统的 3D 卷积神经网络(CNNs)计算开销大、内存密集、易过拟合,且最重要的是需要提升其特征学习能力。为解决这些问题,我们提出时空短时傅里叶变换(STFT)块,一类可作为 3D CNNs 中 3D 卷积层及其变体替代的新卷积块。一个 STFT 块由不可训练的卷积层组成,这些层利用 STFT 核在多个低频点捕获空间及/或时间局部的傅里叶信息,随后接一组可训练的线性权重以学习通道相关性。STFT 块显著降低了 3D CNNs 的时空复杂度。总体而言,与最先进方法相比,其参数量减少 3.5 至 4.5 倍,计算成本降低 1.5 至 1.8 倍。此外,其特征学习能力显著优于传统 3D 卷积层及其变体。我们在七个动作识别数据集(包括 Something-something v1 与 v2、Jester、Diving-48、Kinetics-400、UCF 101 及 HMDB 51)上的广泛评估表明,基于 STFT 块的 3D CNNs 取得了与最先进方法相当甚至更优的性能。

关键词

引用

@article{arxiv.2007.11365,
  title  = {Depthwise Spatio-Temporal STFT Convolutional Neural Networks for Human Action Recognition},
  author = {Sudhakar Kumawat and Manisha Verma and Yuta Nakashima and Shanmuganathan Raman},
  journal= {arXiv preprint arXiv:2007.11365},
  year   = {2021}
}

备注

Extended version of our CVPR 2019 work