中文

DeepHoyer:利用可微尺度不变稀疏性度量学习更稀疏的神经网络

机器学习 2020-01-22 v2 机器学习

摘要

在寻求稀疏且高效的神经网络模型时,许多先前的工作研究了在训练中施加 L1 或 L0 正则化器以促使权重稀疏。L0 正则化器直接度量参数稀疏性且对参数值的缩放不变,但它不能提供有用的梯度,因此需要复杂的优化技术。L1 正则化器几乎处处可微,并且可以用梯度下降轻松优化。然而它并非尺度不变,导致对所有参数以相同速率收缩,在提高稀疏性方面效率低下。受传统压缩感知问题中使用的 Hoyer 度量(L1 与 L2 范数之比)启发,我们提出 DeepHoyer,一组既几乎处处可微又尺度不变的稀疏诱导正则化器。我们的实验表明,在相同精度水平下,施加 DeepHoyer 正则化器能比先前工作产生更稀疏的神经网络模型。我们还展示了 DeepHoyer 可应用于逐元素与结构化剪枝。

关键词

引用

@article{arxiv.1908.09979,
  title  = {DeepHoyer: Learning Sparser Neural Network with Differentiable Scale-Invariant Sparsity Measures},
  author = {Huanrui Yang and Wei Wen and Hai Li},
  journal= {arXiv preprint arXiv:1908.09979},
  year   = {2020}
}

备注

To be appeared in ICLR 2020 (poster presentation)