中文

基于脉冲神经网络的大型语言模型推理引擎

机器学习 2025-10-16 v3

摘要

基于变压器架构的基础模型目前是通用语言建模以及科学领域如材料科学和气候学中的最先进技术。然而,训练和部署这些模型具有计算上的挑战,因为其时间和空间复杂度与输入序列长度成二次关系。已有多项工作探索高效计算范式和模型架构以解决这些限制。本文我们探索使用脉冲神经网络 (SNN) 设计变压器模型。大规模 SNN 使用现有代理学习方法进行训练效率低下且耗时。另一方面,转换现有基于变压器的模型为其 SNN 等价方法在可扩展性方面也不成熟,因为实现最佳性能代价是大量脉冲时间步,即延迟增加。为此,我们提出 NeurTransformer,这是一种用于推断设计基于变压器的 SNN 的方法,采用基于监督的微调方法与现有转换方法。所提出的方法包括:(1) 将自注意力机制替换为基于脉冲的自注意力 (SSA),(2) 将训练好的变压器模型的前馈块转换为其等价 SNN,(3) 使用 SNN 基于代理的学习算法对 SSA 模块进行微调。我们对所提方法进行基准测试,证明其准确性和可扩展性,使用三个模型规模递增的 GPT-2 变体。我们观察到转换后的 GPT-2 小型模型在余弦相似度上损失 5-12%,在 perplexity 上降低 9.7%。最后,我们展示 SSA 模块相对于 ASA 模块在能源效率上的表现,表明在数字硬件上实现自注意力机制时,估计能源消耗降低 64.71% 至 85.28%。

关键词

引用

@article{arxiv.2510.00133,
  title  = {Large Language Models Inference Engines based on Spiking Neural Networks},
  author = {Adarsha Balaji and Sandeep Madireddy and Prasanna Balaprakash},
  journal= {arXiv preprint arXiv:2510.00133},
  year   = {2025}
}