中文

最优脑压缩:一种精确的训练后量化与剪枝框架

机器学习 2023-01-10 v2

摘要

我们考虑深度神经网络(DNNs)在具有挑战性的一次性/训练后设定下的模型压缩问题:给定一个精确的已训练模型,必须仅基于少量校准输入数据在不进行任何重训练的情况下对其进行压缩。鉴于新兴的软件与硬件支持通过剪枝和/或量化压缩的模型以加速执行,且该两种压缩方法均已提出性能良好的独立解决方案,此问题已变得流行。本文中,我们引入一种新压缩框架,其在统一设定下涵盖权值剪枝与量化,具有时间与空间高效性,并显著改进现有训练后方法的实际性能。在技术层面,我们的方法基于经典的 Optimal Brain Surgeon(OBS)[LeCun, Denker, and Solla, 1990] 框架的精确高效实现,并扩展至涵盖现代 DNNs 规模的权值量化。从实际角度看,我们的实验结果表明其能显著改进现有训练后方法的压缩-精度权衡,并能在训练后设定下实现剪枝与量化的准确复合应用。

关键词

引用

@article{arxiv.2208.11580,
  title  = {Optimal Brain Compression: A Framework for Accurate Post-Training Quantization and Pruning},
  author = {Elias Frantar and Sidak Pal Singh and Dan Alistarh},
  journal= {arXiv preprint arXiv:2208.11580},
  year   = {2023}
}

备注

Published at NeurIPS 2022