通过 $\frac{\ell_1}{\ell_2}$ 正则化延迟代理实现端到端神经网络压缩
机器学习
2023-06-14 v2
摘要
通过剪枝、量化等技术进行的神经网络(NN)压缩,需要为每一层手动设置压缩超参数(例如要剪枝的通道数、量化的位宽),或通过神经架构搜索(NAS)设置,而这计算开销可能很大。我们通过提供一种端到端技术来解决此问题,该技术通过新颖的 延迟代理优化模型的浮点运算(FLOPs)或设备端延迟。我们的算法通用性强,可用于许多流行的压缩方法,包括剪枝、低秩分解和量化。关键在于,它速度快,运行时间与单次模型训练几乎相同;相比标准 NAS 方法,这是一个显著的训练加速。对于 GLUE 微调任务上的 BERT 压缩,我们在性能仅下降 的情况下实现了 的 FLOPs 削减。对于 ImageNet-1K 上的 MobileNetV3 压缩,我们在准确率不降的情况下实现了 的 FLOPs 削减和 的设备端延迟削减,同时所需训练计算量仍比 SOTA 压缩技术少 。最后,对于较小数据集上的迁移学习,我们的技术在几乎相同的训练成本和准确率下,识别出的架构比标准 MobileNetV3、EfficientNet 系列架构便宜 -。
引用
@article{arxiv.2306.05785,
title = {End-to-End Neural Network Compression via $\frac{\ell_1}{\ell_2}$ Regularized Latency Surrogates},
author = {Anshul Nasery and Hardik Shah and Arun Sai Suggala and Prateek Jain},
journal= {arXiv preprint arXiv:2306.05785},
year = {2023}
}