重新思考网络剪枝的价值
机器学习
2019-03-06 v2 计算机视觉与模式识别
机器学习
摘要
网络剪枝被广泛用于降低低资源环境下深度模型高昂的推理成本。典型的剪枝算法是一个三阶段流程,即训练(大模型)、剪枝和微调。在剪枝过程中,根据某种准则,冗余权重被剪除,重要权重被保留以最好地保持精度。在本工作中,我们做出了若干与普遍认知相悖的惊人观察。对于我们考察的所有最先进的结构化剪枝算法,微调剪枝后的模型所得性能仅与用随机初始化权重训练该模型相当或更差。对于假设预定义目标网络架构的剪枝算法,可以抛弃完整流程,直接从零训练目标网络。我们的观察在多种网络架构、数据集和任务上保持一致,这意味着:1)训练一个大型、过参数化模型通常并非获得高效最终模型所必需;2)大模型学习到的“重要”权重对小型剪枝模型通常并无用处;3)剪枝后的架构本身,而非一组继承的“重要”权重,对最终模型的效率更为关键,这表明在某些情况下剪枝可作为架构搜索范式发挥作用。我们的结果提示未来结构化剪枝方法研究需要更谨慎的基线评估。我们还将本文与“彩票假设”(Lottery Ticket Hypothesis,Frankle & Carbin 2019)进行比较,发现在最优学习率下,Frankle & Carbin(2019)所用的“中奖票”初始化相较随机初始化并未带来提升。
引用
@article{arxiv.1810.05270,
title = {Rethinking the Value of Network Pruning},
author = {Zhuang Liu and Mingjie Sun and Tinghui Zhou and Gao Huang and Trevor Darrell},
journal= {arXiv preprint arXiv:1810.05270},
year = {2019}
}
备注
ICLR 2019. Significant revisions from the previous version