中文

面向 Transformer 中多头注意力与位置前馈网络的硬件加速器

信号处理 2020-09-21 v1 硬件体系结构

摘要

为深度神经网络(DNN)设计硬件加速器一直备受需求。然而,现有大多数加速器都是为卷积神经网络(CNN)或循环神经网络(RNN)构建的。近来,Transformer 模型正在取代自然语言处理(NLP)领域的 RNN。但由于涉及密集的矩阵计算和复杂的数据流,尚未见针对 Transformer 模型的硬件设计报道。在本文中,我们提出了首个针对两个关键组件——即多头注意力(MHA)ResBlock 和位置前馈网络(FFN)ResBlock——的硬件加速器,它们是 Transformer 中最复杂的两个层。首先,引入了一种高效方法来划分 Transformer 中的巨大矩阵,使两个 ResBlock 能够共享大部分硬件资源。其次,精心设计了计算流,以确保 systolic array(我们设计中最大的模块)的高硬件利用率。第三,对复杂的非线性函数进行了高度优化,以进一步降低硬件复杂度和整个系统的延迟。我们的设计使用硬件描述语言(HDL)编码,并在 Xilinx FPGA 上评估。与相同设置下 GPU 上的实现相比,所提出的设计在 MHA ResBlock 中实现了 14.6 倍的加速,在 FFN ResBlock 中实现了 3.4 倍的加速。因此,本工作为构建高效的多种 Transformer 网络硬件加速器奠定了良好基础。

关键词

引用

@article{arxiv.2009.08605,
  title  = {Hardware Accelerator for Multi-Head Attention and Position-Wise Feed-Forward in the Transformer},
  author = {Siyuan Lu and Meiqi Wang and Shuang Liang and Jun Lin and Zhongfeng Wang},
  journal= {arXiv preprint arXiv:2009.08605},
  year   = {2020}
}

备注

6 pages, 8 figures. This work has been accepted by IEEE SOCC (System-on-chip Conference) 2020, and peresnted by Siyuan Lu in SOCC2020. It also received the Best Paper Award in the Methdology Track in this conference