Adam 在整流神经网络中诱导隐式权重稀疏性
机器学习
2018-12-20 v1 计算机视觉与模式识别
机器学习
摘要
近年来,深度神经网络(DNNs)已被应用于各种机器学习任务,包括图像识别、语音识别和机器翻译。然而,需要大型 DNN 模型才能达到最先进的性能,超出了边缘设备的能力。因此,实际使用中需要模型压缩。在本文中,我们指出在以下三个条件下训练 DNN 时,深度学习会自动诱导权重的组稀疏性,即连接到同一输出通道(节点)的所有权重均为零:(1)修正线性单元(ReLU)激活,(2) 正则化目标函数,以及(3)Adam 优化器。接下来,我们从理论和实验两方面分析这一行为,并提出一种简单的模型压缩方法:在训练 DNN 后消除零权重。在 MNIST 和 CIFAR-10 数据集上的实验中,我们展示了不同训练设置下的稀疏性。最后,我们表明我们的方法能有效减小模型尺寸,并且相对于使用稀疏诱导正则器的方法表现良好。
引用
@article{arxiv.1812.08119,
title = {Adam Induces Implicit Weight Sparsity in Rectifier Neural Networks},
author = {Atsushi Yaguchi and Taiji Suzuki and Wataru Asano and Shuhei Nitta and Yukinobu Sakata and Akiyuki Tanizawa},
journal= {arXiv preprint arXiv:1812.08119},
year = {2018}
}
备注
8 pages, 7 figures, 6 tables, 2018 17th IEEE International Conference on Machine Learning and Applications (ICMLA)