中文

SpikeGPT:基于脉冲神经网络的生成式预训练语言模型

计算与语言 2024-07-12 v5 机器学习 神经与进化计算

摘要

随着大语言模型规模持续扩大,运行所需的计算资源也随之增长。脉冲神经网络(SNNs)已成为一种节能的深度学习途径,利用稀疏且事件驱动的激活来降低模型推理的计算开销。尽管SNNs在许多计算机视觉任务上已能与非脉冲模型竞争,但其训练也更具挑战性。因此,其性能落后于现代深度学习,且我们尚未看到SNNs在语言生成中的有效性。本文受Receptance Weighted Key Value(RWKV)语言模型启发,成功实现了“SpikeGPT”,一种具有二值、事件驱动脉冲激活单元的生成式语言模型。我们在两种模型变体(4500万和2.16亿参数)上训练所提模型。据我们所知,SpikeGPT是迄今最大的反向传播训练的SNN模型,使其适用于自然语言的生成与理解。为此,我们修改transformer模块,以替换多头自注意力,将随序列长度增加的二次计算复杂度O(N^2)降为线性复杂度O(N)。输入token改为像典型SNNs那样顺序流入我们的注意力机制。初步实验表明,SpikeGPT在测试基准上与非脉冲模型保持竞争力,同时在可借助稀疏事件驱动激活的神经形态硬件上处理时减少20倍操作。我们的代码实现见 https://github.com/ridgerchu/SpikeGPT。

关键词

引用

@article{arxiv.2302.13939,
  title  = {SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks},
  author = {Rui-Jie Zhu and Qihang Zhao and Guoqi Li and Jason K. Eshraghian},
  journal= {arXiv preprint arXiv:2302.13939},
  year   = {2024}
}

备注

Accepted by TMLR