CSDformer:用于完全脉冲驱动变换器的转换方法
计算机视觉与模式识别
2025-09-23 v1
摘要
脉冲变换器是一种新型架构,旨在提升脉冲神经网络的性能,同时减轻变换器固有的能耗负担。然而,现有方法生成这些模型存在关键局限:直接训练方法导致训练成本过高,或已有转换方法中不可避免地包含不利于硬件的操作。本文提出了CSDformer,一种用于完全脉冲驱动变换器的新型转换方法。我们设计了一种面向转换的变换器架构,并提出一种新函数NReLU以取代自注意力中的softmax。随后,对该模型进行量化和训练,并通过时序分解技术转换为完全脉冲驱动模型。我们还提出延迟积分发放神经元以减少转换误差并提升脉冲模型性能。在ImageNet、CIFAR-10和CIFAR-100数据集上评估CSDformer,在ImageNet上以7个时间步实现76.36%的Top-1准确率,凸显其优于最新模型的优势。此外,CSDformer消除了对SNN训练的需求,显著降低训练成本(计算资源降低75%,训练速度加快2-3倍)。据我们了解,这是首个通过转换方法开发的全脉冲驱动变换器模型,实现了在超低延迟下的高性能,同时大幅降低计算复杂度和训练开销。
引用
@article{arxiv.2509.17461,
title = {CSDformer: A Conversion Method for Fully Spike-Driven Transformer},
author = {Yuhao Zhang and Chengjun Zhang and Di Wu and Jie Yang and Mohamad Sawan},
journal= {arXiv preprint arXiv:2509.17461},
year = {2025}
}