通过 $L_0$ 正则化学习稀疏神经网络
机器学习
2018-06-25 v2 机器学习
摘要
我们提出一种用于神经网络的 范数正则化的实用方法:在训练期间通过促使权重精确变为零来剪枝网络。此类正则化很有意义,因为(1)它可大幅加速训练与推断,且(2)可改善泛化。知名的模型选择准则 AIC 与 BIC 是 正则化的特例。然而,由于权重的 范数不可微,我们无法将其直接作为正则项纳入目标函数。我们提出一种通过引入一组非负随机门(gate)的解决方案,它们共同决定哪些权重设为零。我们表明,有些令人惊讶地,对于某些门上的分布,所得门控权重的期望 范数关于分布参数可微。我们进一步提出门的 \emph{hard concrete} 分布,其通过“拉伸”二值 concrete 分布再用硬 sigmoid 变换其样本得到。门上分布的参数随后可与原始网络参数联合优化。因此我们的方法允许以随机梯度下降直接高效地学习模型结构,并以原则性方式实现条件计算。我们进行多种实验以证明所得方法与正则化的有效性。
引用
@article{arxiv.1712.01312,
title = {Learning Sparse Neural Networks through $L_0$ Regularization},
author = {Christos Louizos and Max Welling and Diederik P. Kingma},
journal= {arXiv preprint arXiv:1712.01312},
year = {2018}
}
备注
Published as a conference paper at the International Conference on Learning Representations (ICLR) 2018