中文

SwiftTron:一种面向量化 Transformer 的高效硬件加速器

机器学习 2023-04-26 v2

摘要

Transformer 的计算密集型操作给其在资源受限的 EdgeAI / tinyML 设备中的部署带来了巨大挑战。作为一种成熟的神经网络压缩技术,量化可减少硬件的计算与存储资源需求。特别是,定点量化因其可利用底层硬件中轻量级模块(如加法器和乘法器)来简化计算而备受青睐。然而,在现有通用硬件、通用 AI 加速器或带有浮点单元的 Transformer 专用架构上部署全量化 Transformer 可能是不可行和/或低效的。为此,我们提出 SwiftTron,一种为量化 Transformer 设计的高效专用硬件加速器。SwiftTron 支持执行不同类型的 Transformer 操作(如 Attention、Softmax、GELU 和 Layer Normalization),并考虑多种缩放因子以进行正确计算。我们使用 ASIC 设计流程在 6565 nm CMOS 工艺下综合了完整的 SwiftTron 架构。我们的加速器在消耗 33.64 mW 功率、占用 273 mm^2 面积的情况下,以 1.83 ns 执行 RoBERTa-base 模型。为便于复现,我们的 SwiftTron 架构 RTL 已发布于 https://github.com/albertomarchisio/SwiftTron。

关键词

引用

@article{arxiv.2304.03986,
  title  = {SwiftTron: An Efficient Hardware Accelerator for Quantized Transformers},
  author = {Alberto Marchisio and Davide Dura and Maurizio Capra and Maurizio Martina and Guido Masera and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2304.03986},
  year   = {2023}
}

备注

To appear at the 2023 International Joint Conference on Neural Networks (IJCNN), Queensland, Australia, June 2023