中文

通过 $L_0$ 正则化学习稀疏神经网络

机器学习 2018-06-25 v2 机器学习

摘要

我们提出一种用于神经网络的 L0L_0 范数正则化的实用方法:在训练期间通过促使权重精确变为零来剪枝网络。此类正则化很有意义,因为(1)它可大幅加速训练与推断,且(2)可改善泛化。知名的模型选择准则 AIC 与 BIC 是 L0L_0 正则化的特例。然而,由于权重的 L0L_0 范数不可微,我们无法将其直接作为正则项纳入目标函数。我们提出一种通过引入一组非负随机门(gate)的解决方案,它们共同决定哪些权重设为零。我们表明,有些令人惊讶地,对于某些门上的分布,所得门控权重的期望 L0L_0 范数关于分布参数可微。我们进一步提出门的 \emph{hard concrete} 分布,其通过“拉伸”二值 concrete 分布再用硬 sigmoid 变换其样本得到。门上分布的参数随后可与原始网络参数联合优化。因此我们的方法允许以随机梯度下降直接高效地学习模型结构,并以原则性方式实现条件计算。我们进行多种实验以证明所得方法与正则化的有效性。

关键词

引用

@article{arxiv.1712.01312,
  title  = {Learning Sparse Neural Networks through $L_0$ Regularization},
  author = {Christos Louizos and Max Welling and Diederik P. Kingma},
  journal= {arXiv preprint arXiv:1712.01312},
  year   = {2018}
}

备注

Published as a conference paper at the International Conference on Learning Representations (ICLR) 2018