中文

面向基于幅值剪枝的层自适应稀疏度

机器学习 2021-05-11 v2

摘要

近期关于神经网络剪枝的发现表明,借助精心选择的逐层稀疏度,简单的基于幅值的剪枝即可在稀疏度与性能之间实现最优权衡。然而,在缺乏关于“如何选取”的明确共识下,逐层稀疏度多半按算法逐一选择,常诉诸手工启发式或大量超参数搜索。为填补此空白,我们提出一种用于全局剪枝的新型重要性分数,称为层自适应基于幅值的剪枝(LAMP)分数;该分数是对权重幅值的重缩放版本,纳入了由剪枝引起的模型级 2\ell_2 失真,且无需任何超参数调优或繁重计算。在多种图像分类设定下,LAMP持续优于现有的流行逐层稀疏度选择方案。此外,我们观察到即使在权重回绕设定下LAMP仍优于基线,而面向连接性的逐层稀疏度(总体最强基线)在此情形下表现不如简单的全局基于幅值的剪枝。代码:https://github.com/jaeho-lee/layer-adaptive-sparsity

关键词

引用

@article{arxiv.2010.07611,
  title  = {Layer-adaptive sparsity for the Magnitude-based Pruning},
  author = {Jaeho Lee and Sejun Park and Sangwoo Mo and Sungsoo Ahn and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2010.07611},
  year   = {2021}
}

备注

ICLR 2021. Changed title (previous ver: A deeper look at the layerwise sparsity of magnitude-based pruning)