基于算法、架构与数据流协同设计的高效 N:M 稀疏 DNN 训练
机器学习
2023-09-25 v1 人工智能
硬件体系结构
摘要
稀疏训练是在保持高精度的同时降低 DNN 计算开销的有前景技术之一。特别地,N:M 细粒度结构化稀疏(仅连续 M 个元素中 N 个可非零)因其硬件友好模式与高稀疏率能力而受关注。然而,N:M 稀疏 DNN 训练的加速潜力尚未被充分挖掘,且缺乏支持 N:M 稀疏训练的高效硬件。为应对这些挑战,本文提出一种使用算法、架构与数据流协同设计的 N:M 稀疏 DNN 计算高效训练方案。在算法层,提出称为 BDWP 的双向权重剪枝方法,在 DNN 训练的前向与反向传播中利用权重的 N:M 稀疏性,可显著降低计算成本同时保持模型精度。在架构层,开发用于 DNN 训练的稀疏加速器 SAT,以优雅支持规则稠密运算与计算高效的 N:M 稀疏运算。在数据流层,提出从交错映射、N:M 稀疏权重预生成到离线调度的多种优化方法,以提升 SAT 的计算效率。最后,在 Xilinx VCU1525 FPGA 卡上使用多种 DNN 模型与数据集评估训练方案有效性。实验结果表明,采用 2:8 稀疏率下 BDWP 稀疏训练方法的 SAT 加速器相较稠密训练平均加速 1.75x,伴随平均可忽略的 0.56% 精度损失。此外,相较先前基于 FPGA 的加速器,我们提出的训练方案将训练吞吐率提升 2.97~25.22x,能效提升 1.36~3.58x。
引用
@article{arxiv.2309.13015,
title = {Efficient N:M Sparse DNN Training Using Algorithm, Architecture, and Dataflow Co-Design},
author = {Chao Fang and Wei Sun and Aojun Zhou and Zhongfeng Wang},
journal= {arXiv preprint arXiv:2309.13015},
year = {2023}
}
备注
To appear in the IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)