中文

面向高性能脉冲 Transformer 的无训练 ANN-to-SNN 转换

机器学习 2025-12-16 v2 人工智能

摘要

利用事件驱动范式,脉冲神经网络(SNN)为能源高效的 Transformer 架构提供了可行路径。虽然 ANN-to-SNN 转换避免了直接训练脉冲 Transformer 的高额训练成本,但现有方法仍难以处理 Transformer 块中非线性操作,往往需要对预训练的 ANN 进行额外微调。为此,我们提出一种专为 Transformer 架构设计的无训练且高性能的 ANN-to-SNN 转换框架。具体而言,我们引入一种多基指数衰减(MBE)神经元,将指数衰减与多基编码策略相结合,以有效逼近非线性操作,从而无需修改预训练网络的权重。广泛的实验在各种任务(计算机视觉、自然语言理解、自然语言生成)和主流 Transformer 架构(ViT、RoBERTa、GPT-2)上表明,我们的方法实现了接近无损的转换精度,同时显著降低了延迟。这为在实际应用中高效可扩展地部署脉冲 Transformer 提供了可行路径。

关键词

引用

@article{arxiv.2508.07710,
  title  = {Training-Free ANN-to-SNN Conversion for High-Performance Spiking Transformer},
  author = {Jingya Wang and Xin Deng and Wenjie Wei and Dehao Zhang and Shuai Wang and Qian Sun and Jieyuan Zhang and Hanwen Liu and Ning Xie and Malu Zhang},
  journal= {arXiv preprint arXiv:2508.07710},
  year   = {2025}
}