AUTOSPARSE:面向深度神经网络自动化稀疏训练
机器学习
2023-04-17 v1 人工智能
摘要
稀疏训练正成为降低神经网络训练计算成本的一种有前景的途径。最近的若干研究提出了使用可学习阈值的剪枝方法,以高效探索模型内部固有的非均匀稀疏分布。本文提出梯度退火(Gradient Annealing, GA),以非线性方式缩小被掩码权重的梯度。GA 在不需额外稀疏诱导正则化的情况下,提供了稀疏度与精度之间的优雅权衡。我们将 GA 与最新的可学习剪枝方法结合,创建了名为 AutoSparse 的自动化稀疏训练算法,其在 ImageNet-1K 上对稀疏 ResNet50 和 MobileNetV1 取得了比现有可学习剪枝方法更好的精度和/或训练/推理 FLOPS 缩减:AutoSparse 在 80% 稀疏度下于 ImageNet 上实现 ResNet50 的(训练,推理)FLOPS(2倍, 7倍)缩减。最后,AutoSparse 以相近精度优于 80% 稀疏 ResNet50 的稀疏到稀疏 SOTA 方法 MEST(均匀稀疏),其中 MEST 多用了 12% 的训练 FLOPS 和 50% 的推理 FLOPS。
引用
@article{arxiv.2304.06941,
title = {AUTOSPARSE: Towards Automated Sparse Training of Deep Neural Networks},
author = {Abhisek Kundu and Naveen K. Mellempudi and Dharma Teja Vooturi and Bharat Kaul and Pradeep Dubey},
journal= {arXiv preprint arXiv:2304.06941},
year = {2023}
}