训练更窄更深的神经网络:跳跃启动正则化
机器学习
2022-06-07 v2 最优化与控制
摘要
具有多层结构的神经网络表达能力更强。然而,常规训练方法只有在深度不引发梯度爆炸或梯度消失等数值问题时才奏效,而当各层足够宽时此类问题较少出现。但是,为获得更大深度而增加宽度会消耗更多计算资源并导致模型过参数化。模型压缩方法(如量化和剪枝)已部分缓解这些后续问题,其中一些方法依赖基于归一化的损失函数正则化以使多数参数影响可忽略。本文中,我们转而提出使用正则化来防止神经元死亡或线性化,该技术称为跳跃启动正则化(jumpstart regularization)。与常规训练相比,我们得到的神经网络更窄、更深,且最重要的是参数效率更高。
引用
@article{arxiv.2201.12795,
title = {Training Thinner and Deeper Neural Networks: Jumpstart Regularization},
author = {Carles Riera and Camilo Rey and Thiago Serra and Eloi Puertas and Oriol Pujol},
journal= {arXiv preprint arXiv:2201.12795},
year = {2022}
}
备注
CPAIOR 2022 (to appear)