中文

面向低功耗混合专家与多头注意力脉冲变换器的三维加速

神经与进化计算 2024-12-10 v1 人工智能 硬件体系结构

摘要

脉冲神经网络(SNN)提供了一种受大脑启发的事件驱动机制,被认为是解锁高效深度学习的关键。混合专家方法模拟了神经系统的并行分布式处理,引入条件计算策略,在不增加计算操作数量的情况下扩展模型容量。此外,脉冲混合专家自注意力机制增强了表示能力,能够有效捕捉视觉或语言标记中实体的多样模式及其依赖关系。然而,目前缺乏支持脉冲变换器所需的高度并行分布式处理的硬件,而脉冲变换器体现了一种受大脑启发的计算方式。本文提出了首个面向混合专家与多头注意力脉冲变换器的三维硬件架构与设计方法。通过利用三维集成中的 memory-on-logic 和 logic-on-logic 堆叠,我们探索了这种受大脑启发的加速器,采用空间可堆叠电路,与传统二维CMOS集成相比,在能效和延迟方面实现了显著优化。

关键词

引用

@article{arxiv.2412.05540,
  title  = {Towards 3D Acceleration for low-power Mixture-of-Experts and Multi-Head Attention Spiking Transformers},
  author = {Boxun Xu and Junyoung Hwang and Pruek Vanna-iampikul and Yuxuan Yin and Sung Kyu Lim and Peng Li},
  journal= {arXiv preprint arXiv:2412.05540},
  year   = {2024}
}