中文

SVFormer:用于高效视频动作识别的直接训练脉冲变换器

计算机视觉与模式识别 2024-06-24 v1

摘要

视频动作识别(VAR)在监控、医疗和工业自动化等多个领域发挥着关键作用,因而在计算机视觉领域长期是亟待解决的研究热点。随着人工神经网络(ANN)的蓬勃发展,卷积神经网络(CNN)包括2D-CNN和3D-CNN,以及视觉变换器(ViT)的变体,在VAR任务上展现出卓越的性能。然而,这些方法通常因大数据量和由时间维度引入的冗余信息而导致巨大的计算成本。为应对这一挑战,一些研究者转向受大脑启发的脉冲神经网络(SNN),如循环SNN和ANN转换的SNN,利用其内在的时序动力学和能源效率。然而,当前用于VAR的SNN也存在输入预处理复杂、网络构建和训练困难以及对同一视频片段的重复处理等局限,阻碍了其实际部署。在本研究中,我们创新性地提出了用于VAR的直接训练SVFormer(Spiking Video transFormer)。SVFormer集成了局部特征提取、全局自注意力机制,以及SNN的内在动力学、稀疏性和脉冲驱动特性,高效且有效地提取时空特征。我们在两个RGB数据集(UCF101、NTU-RGBD60)和一个神形态学数据集(DVS128-Gesture)上进行评估,结果表明SVFormer以更高效的方式在性能上与主流模型持平。值得注意的是,SVFormer在UCF101上实现了84.03%的Top-1准确率,仅需21 mJ/视频的超低功耗,达到直接训练深度SNN的SOTA水平,显著优于先前模型。

关键词

引用

@article{arxiv.2406.15034,
  title  = {SVFormer: A Direct Training Spiking Transformer for Efficient Video Action Recognition},
  author = {Liutao Yu and Liwei Huang and Chenlin Zhou and Han Zhang and Zhengyu Ma and Huihui Zhou and Yonghong Tian},
  journal= {arXiv preprint arXiv:2406.15034},
  year   = {2024}
}

备注

Accepted by IJCAI 2024 workshop - Human Brain and Artificial Intelligence