用于剪枝极深神经网络的整体稀疏动量SGD
机器学习
2019-10-28 v3 计算机视觉与模式识别
机器学习
摘要
深度神经网络(DNN)功能强大,但计算开销大且内存密集,从而阻碍其在资源受限前端设备上的实际 usage。DNN 剪枝是一种深度模型压缩方法,旨在以可容忍的性能下降消除部分参数。本文提出一种基于动量-SGD 的新型优化方法,通过在线剪枝降低网络复杂度。具体而言,给定整体压缩比,我们在每次训练迭代将所有参数分为两部分,并使用不同规则更新。这样,我们逐渐将冗余参数置零,因为我们仅使用普通权重衰减而非来自目标函数的梯度来更新它们。与先前需要大量人工调节逐层稀疏比、通过求解复杂不可微问题剪枝或剪枝后微调模型的方法不同,我们的方法特点是:1)自动寻找合适逐层稀疏比的整体压缩;2)端到端训练;3)剪枝后无需耗时的重训练过程;4)更强的寻找具有初始化彩票获胜属性的更优 winning tickets 的能力。
引用
@article{arxiv.1909.12778,
title = {Global Sparse Momentum SGD for Pruning Very Deep Neural Networks},
author = {Xiaohan Ding and Guiguang Ding and Xiangxin Zhou and Yuchen Guo and Jungong Han and Ji Liu},
journal= {arXiv preprint arXiv:1909.12778},
year = {2019}
}
备注
Accepted by NeurIPS 2019