SpikingResformer:在脉冲神经网络中桥接ResNet与视觉Transformer
神经与进化计算
2024-03-29 v2 计算机视觉与模式识别
机器学习
摘要
视觉Transformer在人工神经网络(ANN)中的显著成功,引发了将自注意力机制和基于Transformer的架构融入脉冲神经网络(SNN)的日益浓厚的兴趣。虽然现有方法提出了与SNN兼容的脉冲自注意力机制,但它们缺乏合理的缩放方法,并且这些方法提出的整体架构在有效提取局部特征方面存在瓶颈。为了解决这些挑战,我们提出了一种新颖的脉冲自注意力机制,名为双脉冲自注意力(DSSA),并配备了合理的缩放方法。基于DSSA,我们提出了一种新颖的脉冲视觉Transformer架构,称为SpikingResformer,它将基于ResNet的多阶段架构与我们提出的DSSA相结合,以在减少参数的同时提高性能和能效。实验结果表明,与其他脉冲视觉Transformer对应模型相比,SpikingResformer以更少的参数和更低的能耗实现了更高的准确率。值得注意的是,我们的SpikingResformer-L在ImageNet上以4个时间步长达到了79.40%的top-1准确率,这是SNN领域的最先进结果。
引用
@article{arxiv.2403.14302,
title = {SpikingResformer: Bridging ResNet and Vision Transformer in Spiking Neural Networks},
author = {Xinyu Shi and Zecheng Hao and Zhaofei Yu},
journal= {arXiv preprint arXiv:2403.14302},
year = {2024}
}
备注
To be published in the 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)