通过探索GPGPU友好稀疏性加速DNN训练
机器学习
2022-03-14 v1 硬件体系结构
摘要
深度神经网络(DNN)的训练阶段消耗大量的处理时间与能量。利用DNN稀疏性的压缩技术可有效加速DNN的推理阶段。然而,它很少用于训练阶段,因为训练阶段涉及使用通用图形处理器(GPGPU)的稠密矩阵乘法,其支持规则且结构化的数据布局。本文中,我们首先提出近似随机丢弃(Approximate Random Dropout),用规则且在线生成的基于行或基于块的丢弃模式替代传统的神经元与突触随机丢弃,以消除多层感知机(MLP)和长短期记忆(LSTM)中不必要的计算与数据访问。然后我们开发了基于SGD的搜索算法,生成基于行或基于块的丢弃模式分布,以补偿潜在的精度损失。此外,针对卷积神经网络(CNN)训练加速,我们首先探究了输入特征图的重要性和敏感性;然后提出敏感性感知丢弃方法,根据其敏感性动态丢弃输入特征图,从而在保留更好神经网络精度的同时实现更大的前向与反向训练加速。为便于DNN编程,我们构建了一个DNN训练计算框架,在软件栈中统一了所提出的技术。因此,GPGPU只需支持基本算子——矩阵乘法,即可不论DNN模型而实现显著的性能提升。
引用
@article{arxiv.2203.05705,
title = {DNN Training Acceleration via Exploring GPGPU Friendly Sparsity},
author = {Zhuoran Song and Yihong Xu and Han Li and Naifeng Jing and Xiaoyao Liang and Li Jiang},
journal= {arXiv preprint arXiv:2203.05705},
year = {2022}
}