SpikeVideoFormer:一种具有Hamming注意力和$\mathcal{O}(T)$复杂度的高效尖峰驱动视频Transformer
计算机视觉与模式识别
2025-05-16 v1 人工智能
机器学习
摘要
脉冲神经网络(SNN)在各种视觉任务中展现出对人工神经网络(ANN)的竞争性能,同时具有更高的能源效率。然而,现有的SNN基于Transformer主要关注单张图像任务,强调空间特征,未能有效利用SNN在视频基于视觉任务中的效率。在本文中,我们引入SpikeVideoFormer,这是一种高效的尖峰驱动视频Transformer,特点是线性时序复杂度。具体而言,我们设计了一种脉冲驱动Hamming注意力(SDHA),为从传统实值注意力向脉冲驱动注意力的转变提供了理论指导。基于SDHA,我们进一步分析了各种脉冲驱动时空注意力设计,确定一种在保持线性时序复杂度的同时为视频任务提供出色性能的 optimal方案。我们的模型在不同下游视频任务上的泛化能力和效率得到验证,包括分类、人体姿态跟踪和语义分割。实验结果表明,我们的方法在现有SNN方法中实现了最先进(SOTA)性能,在后两种任务上均超过15%。此外,它在保持显著效率提升的同时,匹配了最新ANN方法的性能,分别在三个任务上实现了、和的提升。https://github.com/JimmyZou/SpikeVideoFormer
引用
@article{arxiv.2505.10352,
title = {SpikeVideoFormer: An Efficient Spike-Driven Video Transformer with Hamming Attention and $\mathcal{O}(T)$ Complexity},
author = {Shihao Zou and Qingfeng Li and Wei Ji and Jingjing Li and Yongkui Yang and Guoqi Li and Chao Dong},
journal= {arXiv preprint arXiv:2505.10352},
year = {2025}
}
备注
Accepted by ICML 2025