中文

Adam 在整流神经网络中诱导隐式权重稀疏性

机器学习 2018-12-20 v1 计算机视觉与模式识别 机器学习

摘要

近年来,深度神经网络(DNNs)已被应用于各种机器学习任务,包括图像识别、语音识别和机器翻译。然而,需要大型 DNN 模型才能达到最先进的性能,超出了边缘设备的能力。因此,实际使用中需要模型压缩。在本文中,我们指出在以下三个条件下训练 DNN 时,深度学习会自动诱导权重的组稀疏性,即连接到同一输出通道(节点)的所有权重均为零:(1)修正线性单元(ReLU)激活,(2)L2L_2 正则化目标函数,以及(3)Adam 优化器。接下来,我们从理论和实验两方面分析这一行为,并提出一种简单的模型压缩方法:在训练 DNN 后消除零权重。在 MNIST 和 CIFAR-10 数据集上的实验中,我们展示了不同训练设置下的稀疏性。最后,我们表明我们的方法能有效减小模型尺寸,并且相对于使用稀疏诱导正则器的方法表现良好。

关键词

引用

@article{arxiv.1812.08119,
  title  = {Adam Induces Implicit Weight Sparsity in Rectifier Neural Networks},
  author = {Atsushi Yaguchi and Taiji Suzuki and Wataru Asano and Shuhei Nitta and Yukinobu Sakata and Akiyuki Tanizawa},
  journal= {arXiv preprint arXiv:1812.08119},
  year   = {2018}
}

备注

8 pages, 7 figures, 6 tables, 2018 17th IEEE International Conference on Machine Learning and Applications (ICMLA)