中文

通过 $\frac{\ell_1}{\ell_2}$ 正则化延迟代理实现端到端神经网络压缩

机器学习 2023-06-14 v2

摘要

通过剪枝、量化等技术进行的神经网络(NN)压缩,需要为每一层手动设置压缩超参数(例如要剪枝的通道数、量化的位宽),或通过神经架构搜索(NAS)设置,而这计算开销可能很大。我们通过提供一种端到端技术来解决此问题,该技术通过新颖的 12\frac{\ell_1}{\ell_2} 延迟代理优化模型的浮点运算(FLOPs)或设备端延迟。我们的算法通用性强,可用于许多流行的压缩方法,包括剪枝、低秩分解和量化。关键在于,它速度快,运行时间与单次模型训练几乎相同;相比标准 NAS 方法,这是一个显著的训练加速。对于 GLUE 微调任务上的 BERT 压缩,我们在性能仅下降 1%1\% 的情况下实现了 50%50\% 的 FLOPs 削减。对于 ImageNet-1K 上的 MobileNetV3 压缩,我们在准确率不降的情况下实现了 15%15\% 的 FLOPs 削减和 11%11\% 的设备端延迟削减,同时所需训练计算量仍比 SOTA 压缩技术少 3×3\times。最后,对于较小数据集上的迁移学习,我们的技术在几乎相同的训练成本和准确率下,识别出的架构比标准 MobileNetV3、EfficientNet 系列架构便宜 1.2×1.2\times-1.4×1.4\times

关键词

引用

@article{arxiv.2306.05785,
  title  = {End-to-End Neural Network Compression via $\frac{\ell_1}{\ell_2}$ Regularized Latency Surrogates},
  author = {Anshul Nasery and Hardik Shah and Arun Sai Suggala and Prateek Jain},
  journal= {arXiv preprint arXiv:2306.05785},
  year   = {2023}
}