MSVIT:通过多尺度注意力融合提升脉冲视觉 Transformer
计算机视觉与模式识别
2025-06-19 v3 人工智能
摘要
脉冲神经网络(SNN)与视觉 Transformer 架构的结合因其潜在的能源效率和高性能计算优势而受到广泛关注。然而,现有方法提出的脉冲自注意力机制虽能成功与 SNN 集成,但其提出的整体架构在有效提取不同图像尺度特征方面存在瓶颈。为此,本文提出 MSVIT。该 novel 脉冲驱动 Transformer 架构首先使用多尺度脉冲注意力(MSSA)增强脉冲注意力模块的能力。我们在 various 主数据集上验证了该方法。实验结果表明,MSVIT 在现有 SNN 基模型上取得了优异表现,作为 SNN-Transformer 架构,确立了最先进的解决方案地位。代码已提供于 https://github.com/Nanhu-AI-Lab/MSViT。
引用
@article{arxiv.2505.14719,
title = {MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion},
author = {Wei Hua and Chenlin Zhou and Jibin Wu and Yansong Chua and Yangyang Shu},
journal= {arXiv preprint arXiv:2505.14719},
year = {2025}
}
备注
11pages, 2figures, accepted by IJCAI'25 (34th International Joint Conference on Artificial Intelligence)