中文

带有视觉移视注意力的脉冲视觉Transformer

计算机视觉与模式识别 2025-02-19 v1 人工智能

摘要

脉冲神经网络(SNN)与视觉Transformer(ViT)的结合有望实现能源效率与高性能,尤其适用于边缘视觉应用。然而,基于SNN的ViT仍存在与ANN型ViT之间的显著性能差距。本文首先分析基于SNN的ViT为何性能受限,识别出基础自注意力机制与时空脉冲序列之间的不匹配。这一不匹配导致空间相关性下降和时序相互作用受限。为此,我们灵感来源于生物视觉移视注意力机制,提出创新的Saccadic Spike Self-Attention(SSSA)方法。具体而言,在空间域中,SSSA采用基于脉冲分布的方法有效评估SNN-based ViT中Query和Key配对的相关性。在时序域中,SSSA引入移视相互作用模块,在每个时间步动态聚焦于选定视觉区域,通过时序相互作用显著提升整体场景理解。基于SSSA机制,我们开发了SNN-based Vision Transformer(SNN-ViT)。广泛的实验表明,SNN-ViT在各种视觉任务上实现了最先进的性能,并具有线性计算复杂度。SNN-ViT的有效性与效率凸显了其在电力敏感型边缘视觉应用中的潜力。

关键词

引用

@article{arxiv.2502.12677,
  title  = {Spiking Vision Transformer with Saccadic Attention},
  author = {Shuai Wang and Malu Zhang and Dehao Zhang and Ammar Belatreche and Yichen Xiao and Yu Liang and Yimeng Shan and Qian Sun and Enqi Zhang and Yang Yang},
  journal= {arXiv preprint arXiv:2502.12677},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025