旋转 ReLU 以隐式稀疏化深度网络
机器学习
2022-06-02 v1
摘要
在基于深度神经网络解决多种现实任务的年代,拥有紧凑且节能的可部署模型已变得相当重要。多数现有深度架构使用修正线性单元(ReLU)激活。本文中,我们提出旋转 ReLU 激活的新思路,为架构赋予额外一个自由度。我们表明,该激活中旋转通过训练学习,会导致网络中对于任务不重要的参数/滤波器被消除。换言之,旋转 ReLU 似乎在进行隐式稀疏化。旋转 ReLU 激活的斜率充当粗粒度特征提取器,不必要特征可在重训练前被消除。我们的研究表明,在 ResNet 及其变体等架构中,特征总是选择经过更少数量的滤波器。因此,通过旋转 ReLU,不必要权重或滤波器被自动识别并可被丢弃,从而显著节省内存与计算。此外,在某些情况下,我们还注意到除节省内存与计算外,在 MNIST、CIFAR-10、CIFAR-100 和 SVHN 等流行数据集上我们也获得了相对于相应基线工作所报告性能的改进。
引用
@article{arxiv.2206.00488,
title = {Rotate the ReLU to implicitly sparsify deep networks},
author = {Nancy Nayak and Sheetal Kalyani},
journal= {arXiv preprint arXiv:2206.00488},
year = {2022}
}