深度整流网络中神经元死亡的概率界
机器学习
2021-06-14 v2 神经与进化计算
机器学习
摘要
神经元死亡是一种复杂现象,对模型可训练性有影响:网络越深,找到有效初始化的概率越低。本工作中,我们推导了 ReLU 网络初始化为可训练点的概率的上界与下界,作为模型超参数的函数。我们表明,只要宽度也随之增加,就有可能无限增加网络深度。此外,在合理假设下我们的界是渐近紧的:首先,上界与具有最大可能输入集的单层网络的真实概率一致。其次,随着输入集收缩至单点,或在关于输出方差的假设下网络复杂度增长时,真实概率收敛至我们的下界。我们通过数值模拟证实了这些结果,显示出随网络深度增加快速收敛至下界。进而,受理论启发,我们提出了一种实用的符号翻转方案,保证 层网络中存活数据点比例至少为 。最后,我们展示了这些议题如何被当前实践中可见的网络设计特性(如批量归一化、残差连接、稠密网络与跳跃连接)所缓解。这表明神经元死亡或可增进对各种模型架构有效性的理解。
引用
@article{arxiv.2007.06192,
title = {Probabilistic bounds on neuron death in deep rectifier networks},
author = {Blaine Rister and Daniel L. Rubin},
journal= {arXiv preprint arXiv:2007.06192},
year = {2021}
}