面向深度学习推理中位稀疏性利用的零跳跃MAC设计的商业评估
硬件体系结构
2025-01-03 v2
摘要
由乘累加(MAC)阵列组成的通用矩阵乘法(GEMM)单元执行深度学习(DL)中的大部分计算。近期工作提出了一种新颖的MAC设计——Bit-Pragmatic (PRA),能够动态利用位稀疏性。本工作提出了OzMAC(Omit-zero-MAC),这是对PRA的修改重新实现,但超越了早期工作,通过使用TSMC N5工艺节点,在多种位宽和时钟频率下对二进制MAC设计进行严格的后综合评估,以评估其商业实现潜力。我们证明了在八个预训练的INT8 DL工作负载中存在高位稀疏性,并表明8位OzMAC在面积、功耗和能量三个指标上分别显著提升了21%、70%和28%。在缩放数据精度(4、8、16位)和时钟频率(0.5 GHz、1 GHz、1.5 GHz)时也实现了类似的改进。对于8位OzMAC,通过缩放其频率以归一化吞吐量,它在功耗和能量上仍能实现30%的改进。
引用
@article{arxiv.2402.19376,
title = {Commercial Evaluation of Zero-Skipping MAC Design for Bit Sparsity Exploitation in DL Inference},
author = {Harideep Nair and Prabhu Vellaisamy and Tsung-Han Lin and Perry Wang and Shawn Blanton and John Paul Shen},
journal= {arXiv preprint arXiv:2402.19376},
year = {2025}
}
备注
Pre-print version of the publication in VLSI-SoC 2024