中文

X-Former:Transformer 的内存内加速

机器学习 2023-03-15 v1 硬件体系结构

摘要

Transformer 因注意力机制而在各种自然语言处理(NLP)任务中取得巨大成功,该机制为序列中每个词相对于其他词分配重要性分数。然而,这些模型非常庞大,参数常达数千亿,因此需要大量 DRAM 访问。因此,GPU 和 TPU 等传统深度神经网络(DNN)加速器在高效处理 Transformer 时面临局限。基于非易失性内存的内存内加速器有望成为应对该挑战的有效方案,因为它们在高存储密度的同时可在内存阵列内执行大规模并行矩阵向量乘法。然而,Transformer(不同于 CNN 和 RNN)中频繁使用的注意力分数计算需要矩阵向量乘法(MVM),其中两个操作数对每个输入都动态变化。结果,传统的基于 NVM 的加速器在用于 Transformer 时产生高写入延迟和写入能耗,并进一步受大多数 NVM 技术低耐久性的困扰。为应对这些挑战,我们提出 X-Former,一种由 NVM 和 CMOS 处理单元混合组成以高效执行 transformer 工作负载的内存内硬件加速器。为提高 X-Former 的硬件利用率,我们还提出了一种序列分块数据流,其重叠两个处理单元的计算并减少执行时间。在多个基准测试中,我们显示 X-Former 相比 NVIDIA GeForce GTX 1060 GPU 在延迟和能耗上分别实现高达 85 倍和 7.5 倍的提升,相比最先进的内存内 NVM 加速器在延迟和能耗上分别实现高达 10.7 倍和 4.6 倍的提升。

关键词

引用

@article{arxiv.2303.07470,
  title  = {X-Former: In-Memory Acceleration of Transformers},
  author = {Shrihari Sridharan and Jacob R. Stevens and Kaushik Roy and Anand Raghunathan},
  journal= {arXiv preprint arXiv:2303.07470},
  year   = {2023}
}