脉动张量阵列:一种用于移动端 CNN 推理的高效结构化稀疏 GEMM 加速器
分布式、并行与集群计算
2020-05-19 v1 硬件体系结构
机器学习
信号处理
摘要
移动设备上的卷积神经网络(CNN)推理需要对低精度(INT8)通用矩阵乘法(GEMM)的高效硬件加速。脉动阵列(SA)是一种流水化的二维处理单元(PE)阵列,具有非常高效的局部数据移动,十分适合加速 GEMM,并已广泛部署于工业界。本工作中,我们描述了针对传统 SA 架构的两项重要改进,以专门优化 CNN 推理。首先,我们将传统标量 PE 推广为张量-PE(Tensor-PE),由此产生一系列新的脉动张量阵列(STA)微架构。STA 系列提升了 PE 内操作数复用与数据通路效率,在 INT8 操作数、同等吞吐下,与传统 SA 相比电路面积与功耗分别降低多达 2.08 倍和 1.36 倍。其次,我们扩展该设计以支持一种称为密度有界块(DBB)的新型块稀疏数据格式。该变体(STA-DBB)在处理特殊训练的 DBB 稀疏模型时,在同等吞吐下面积与功耗分别较 SA 基线提升 3.14 倍和 1.97 倍,同时完全向后兼容稠密模型。
引用
@article{arxiv.2005.08098,
title = {Systolic Tensor Array: An Efficient Structured-Sparse GEMM Accelerator for Mobile CNN Inference},
author = {Zhi-Gang Liu and Paul N. Whatmough and Matthew Mattina},
journal= {arXiv preprint arXiv:2005.08098},
year = {2020}
}
备注
Accepted by IEEE Computer Architecture Letters on 3/4/2020