权重块稀疏:训练、编译与 AI 引擎加速器
机器学习
2024-07-16 v1 硬件体系结构
计算与语言
摘要
如今,越来越大的深度神经网络(DNN)正在被开发、训练和使用。这些网络需要巨大的计算资源,对高端和受限设备都构成了压力。我们的解决方案是实现权重块稀疏(weight block sparsity),这是一种对硬件友好的结构稀疏性。通过对预训练 DNN 模型的卷积和全连接层参数的某些部分置零,我们可以高效地加快 DNN 的推理过程。这导致更小的内存占用、更快的通信以及更少的运算。我们的工作提出了一个垂直系统,允许在合理的时间内利用单块 GPU 对卷积和矩阵乘法权重实现 8×8 块稀疏性。编译器识别这种稀疏性,并用于数据压缩和计算线程划分。此类数据块充分利用了空间局部性和时间局部性,为快速向量运算和内存复用铺平了道路。我们使用该系统在 ResNet50 模型上,将权重减半且几乎不损失准确率,从而实现了两倍的推理速度。我们将呈现针对 AIE2 配置集(AMD Versal FPGA)的性能估计,包括 ResNet50、Inception V3 和 VGG16,以展示硬件叠加设计与软件堆栈在编译和执行机器学习应用程序方面的必要协同作用。
引用
@article{arxiv.2407.09453,
title = {Weight Block Sparsity: Training, Compilation, and AI Engine Accelerators},
author = {Paolo D'Alberto and Taehee Jeong and Akshai Jain and Shreyas Manjunath and Mrinal Sarmah and Samuel Hsu and Yaswanth Raparti and Nitesh Pipralia},
journal= {arXiv preprint arXiv:2407.09453},
year = {2024}
}
备注
12 pages, 10 figures, 1 table