通过结构化激活剪枝压缩大规模神经架构的反向传播
机器学习
2023-11-30 v2 性能
摘要
深度神经网络(DNNs)的兴起导致模型规模与复杂度增加,使 GPU 的内存容量承压。DNNs 中的稀疏性,分为结构性与暂时性两类,已作为解决方案受到关注。本工作聚焦于暂时性稀疏性,旨在降低训练期间的内存消耗。它强调了激活——这一常被忽视的组件——的重要性及其在内存使用中的作用。本工作采用块稀疏压缩行(BSR)格式的结构化剪枝,结合基于幅值的准则来高效剪枝激活。我们进一步为 GPU 引入了高效的块稀疏算子,并展示了其有效性,以及块稀疏所提供的更优压缩比。我们以 ResMLP 在图像分类任务上的大规模神经架构为例,通过评估训练速度、准确率与内存使用来报告激活剪枝的有效性。结果我们观察到在保持准确率的同时内存减少高达 32%。最终,我们的方法旨在使大规模模型训练平民化、降低 GPU 需求,并应对生态关切。
引用
@article{arxiv.2311.16883,
title = {Compressing the Backward Pass of Large-Scale Neural Architectures by Structured Activation Pruning},
author = {Daniel Barley and Holger Fröning},
journal= {arXiv preprint arXiv:2311.16883},
year = {2023}
}
备注
8 pages, 11 figures, submitted to the 6th AccML workshop at HiPEAC conference 2024