HALO:通过学习收缩剪枝神经网络
机器学习
2021-03-02 v3 计算机视觉与模式识别
机器学习
摘要
深度神经网络通过从非结构化数据中提取丰富的特征集,在多种任务上取得了最先进的性能,然而这种性能与模型大小密切相关。现代用于诱导稀疏性和减小模型大小的技术有:(1) 网络剪枝,(2) 使用诱导稀疏性的惩罚项进行训练,以及 (3) 与网络权重联合训练二值掩码。我们从贝叶斯层次模型的角度研究了不同的稀疏性诱导惩罚项,并提出了一种称为分层自适应 Lasso(Hierarchical Adaptive Lasso, HALO)的新惩罚项,它通过可训练参数学习自适应地稀疏化给定网络的权重。当用于训练过参数化网络时,我们的惩罚项能在无需微调的情况下产生高精度的小型子网络。在经验上,在图像识别任务中,我们发现 HALO 能够学习到高度稀疏的网络(仅 5% 的参数),并在相同稀疏度水平下比最先进的幅度剪枝方法有显著的性能提升。代码可在 https://github.com/skyler120/sparsity-halo 获取。
引用
@article{arxiv.2008.10183,
title = {HALO: Learning to Prune Neural Networks with Shrinkage},
author = {Skyler Seto and Martin T. Wells and Wenyu Zhang},
journal= {arXiv preprint arXiv:2008.10183},
year = {2021}
}
备注
Accepted at SDM 2021