Dep-$L_0$: 通过依赖建模改进基于 $L_0$ 的网络稀疏化
机器学习
2021-07-02 v1 计算机视觉与模式识别
摘要
使用 正则化训练深度神经网络是网络剪枝或稀疏化的主要方法之一。该方法通过促使权重精确变为零而在训练过程中剪枝网络。然而,Gale 等人近期的工作揭示,尽管该方法在较小数据集上能获得高压缩率,但其在大规模学习任务(如 ImageNet 上的 ResNet50)上表现不一致。我们通过变分推断的视角分析这一现象,发现其很可能源于对二元门控的独立建模,即平均场近似——在贝叶斯统计中,这种粗略近似因其糟糕的性能而为人所知。为缓解这一缺陷,我们提出一种二元门控的依赖建模,其可有效地建模为一个多层感知机(MLP)。我们将算法命名为 Dep-,因其通过支持依赖的 正则化来剪枝网络。在 CIFAR10、CIFAR100 和 ImageNet 上使用 VGG16、ResNet50、ResNet56 的大量实验表明,我们的 Dep- 以显著优势优于 Louizos 等人的原始 -HC 算法,尤其在 ImageNet 上。与最先进的网络稀疏化算法相比,我们的依赖建模使得基于 的稀疏化在大规模学习任务上再次极具竞争力。我们的源代码可在 https://github.com/leo-yangli/dep-l0 获取。
引用
@article{arxiv.2107.00070,
title = {Dep-$L_0$: Improving $L_0$-based Network Sparsification via Dependency Modeling},
author = {Yang Li and Shihao Ji},
journal= {arXiv preprint arXiv:2107.00070},
year = {2021}
}
备注
Published as a conference paper at ECML 2021