深度网络的激活函数设计:线性与有效初始化
机器学习
2021-05-18 v1
摘要
深度神经网络中所采用的激活函数对网络在初始化时的性能有很大影响,而这进而对训练产生影响。本文中我们研究如何避免先前工作中指出的初始化时的两个问题:成对输入相关性的快速收敛,以及梯度消失与爆炸。我们证明,通过选择一种在原点附近具有相对于网络随机初始化的偏置方差 足够大线性区域的激活函数,这两个问题均可避免。我们通过经验证明,使用此类激活函数可在实践中带来切实益处,无论是在测试与训练精度还是训练时间方面。此外,我们观察到线性区域之外的非线性激活形状对训练的影响似乎相对有限。最后,我们的结果也使我们能够在一个新的超参数机制中训练网络,其偏置方差远大于先前可能的范围。
引用
@article{arxiv.2105.07741,
title = {Activation function design for deep networks: linearity and effective initialisation},
author = {Michael Murray and Vinayak Abrol and Jared Tanner},
journal= {arXiv preprint arXiv:2105.07741},
year = {2021}
}
备注
33 pages, 10 figures, paper code and scripts are hosted at https://github.com/Cross-Caps/AFLI