中文

SpikeVideoFormer:一种具有Hamming注意力和$\mathcal{O}(T)$复杂度的高效尖峰驱动视频Transformer

计算机视觉与模式识别 2025-05-16 v1 人工智能 机器学习

摘要

脉冲神经网络(SNN)在各种视觉任务中展现出对人工神经网络(ANN)的竞争性能,同时具有更高的能源效率。然而,现有的SNN基于Transformer主要关注单张图像任务,强调空间特征,未能有效利用SNN在视频基于视觉任务中的效率。在本文中,我们引入SpikeVideoFormer,这是一种高效的尖峰驱动视频Transformer,特点是线性时序复杂度O(T)\mathcal{O}(T)。具体而言,我们设计了一种脉冲驱动Hamming注意力(SDHA),为从传统实值注意力向脉冲驱动注意力的转变提供了理论指导。基于SDHA,我们进一步分析了各种脉冲驱动时空注意力设计,确定一种在保持线性时序复杂度的同时为视频任务提供出色性能的 optimal方案。我们的模型在不同下游视频任务上的泛化能力和效率得到验证,包括分类、人体姿态跟踪和语义分割。实验结果表明,我们的方法在现有SNN方法中实现了最先进(SOTA)性能,在后两种任务上均超过15%。此外,它在保持显著效率提升的同时,匹配了最新ANN方法的性能,分别在三个任务上实现了×16\times 16×10\times 10×5\times 5的提升。https://github.com/JimmyZou/SpikeVideoFormer

关键词

引用

@article{arxiv.2505.10352,
  title  = {SpikeVideoFormer: An Efficient Spike-Driven Video Transformer with Hamming Attention and $\mathcal{O}(T)$ Complexity},
  author = {Shihao Zou and Qingfeng Li and Wei Ji and Jingjing Li and Yongkui Yang and Guoqi Li and Chao Dong},
  journal= {arXiv preprint arXiv:2505.10352},
  year   = {2025}
}

备注

Accepted by ICML 2025