稀疏深度神经网络的鲁棒学习
机器学习
2023-01-16 v3
摘要
我们提出了一种同步学习与剪枝算法,能够在训练早期阶段识别并消除神经网络中无关的结构,从而显著降低后续训练迭代(除推理外)的计算成本。我们的方法基于变分推断原理,对神经网络权重使用高斯尺度混合先验,学习乘以各单元/滤波器的伯努利随机变量的变分后验分布,类似于自适应 dropout。我们的算法确保伯努利参数实际收敛到 0 或 1,从而建立一个确定性的最终网络。我们解析地推导出一种作用于先验参数上的新颖超先验分布,这对于其最优选择至关重要,并能带来一致的剪枝水平与预测精度,且与权重初始化或初始网络规模无关。我们证明了算法的收敛性质,建立了理论与实际的剪枝条件。我们在 MNIST 和 CIFAR-10 数据集以及常用的全连接和卷积 LeNet 与 VGG16 架构上评估了所提算法。仿真表明,我们的方法在结构化剪枝方面达到了与 SOTA 方法相当的剪枝水平,同时保持更好的测试精度,更重要的是,其方式对网络初始化和初始规模具有鲁棒性。
引用
@article{arxiv.2205.04650,
title = {Robust Learning of Parsimonious Deep Neural Networks},
author = {Valentin Frank Ingmar Guenter and Athanasios Sideris},
journal= {arXiv preprint arXiv:2205.04650},
year = {2023}
}
备注
39 pages, 5 figures, 6 tables. Updated version of arXiv:2205.04650; added experiments with CIFAR10 dataset/VGG16 architecture and modified introduction