中文

脉动张量阵列:一种用于移动端 CNN 推理的高效结构化稀疏 GEMM 加速器

分布式、并行与集群计算 2020-05-19 v1 硬件体系结构 机器学习 信号处理

摘要

移动设备上的卷积神经网络(CNN)推理需要对低精度(INT8)通用矩阵乘法(GEMM)的高效硬件加速。脉动阵列(SA)是一种流水化的二维处理单元(PE)阵列,具有非常高效的局部数据移动,十分适合加速 GEMM,并已广泛部署于工业界。本工作中,我们描述了针对传统 SA 架构的两项重要改进,以专门优化 CNN 推理。首先,我们将传统标量 PE 推广为张量-PE(Tensor-PE),由此产生一系列新的脉动张量阵列(STA)微架构。STA 系列提升了 PE 内操作数复用与数据通路效率,在 INT8 操作数、同等吞吐下,与传统 SA 相比电路面积与功耗分别降低多达 2.08 倍和 1.36 倍。其次,我们扩展该设计以支持一种称为密度有界块(DBB)的新型块稀疏数据格式。该变体(STA-DBB)在处理特殊训练的 DBB 稀疏模型时,在同等吞吐下面积与功耗分别较 SA 基线提升 3.14 倍和 1.97 倍,同时完全向后兼容稠密模型。

关键词

引用

@article{arxiv.2005.08098,
  title  = {Systolic Tensor Array: An Efficient Structured-Sparse GEMM Accelerator for Mobile CNN Inference},
  author = {Zhi-Gang Liu and Paul N. Whatmough and Matthew Mattina},
  journal= {arXiv preprint arXiv:2005.08098},
  year   = {2020}
}

备注

Accepted by IEEE Computer Architecture Letters on 3/4/2020