中文

目标归一化与动量对死亡 ReLU 的影响

机器学习 2020-05-14 v1 机器学习

摘要

使用动量优化参数、归一化数据值以及采用修正线性单元 (ReLU) 是神经网络 (NN) 回归中的常见选择。尽管 ReLU 很流行,它们可能坍缩为常数函数并“死亡”,从而有效地从模型中移除其贡献。虽然已知一些缓解方法,但 ReLU 在优化期间死亡的根本原因目前仍知之甚少。在本文中,我们考虑目标归一化和动量对死亡 ReLU 的影响。我们通过经验发现单位方差目标是合理动机,且当目标方差趋近于零时 ReLU 更容易死亡。为进一步研究此事,我们分析了一个离散时间线性自治系统,并从理论上展示这如何关联到带单个 ReLU 的模型以及常见属性如何导致死亡 ReLU。我们还分析了单 ReLU 模型的梯度以识别鞍点及对应死亡 ReLU 的区域,以及当使用动量时参数如何演化进入这些区域。最后,我们通过经验表明该问题在包括残差网络在内的更深模型中持续存在且被加剧。

关键词

引用

@article{arxiv.2005.06195,
  title  = {The effect of Target Normalization and Momentum on Dying ReLU},
  author = {Isac Arnekvist and J. Frederico Carvalho and Danica Kragic and Johannes A. Stork},
  journal= {arXiv preprint arXiv:2005.06195},
  year   = {2020}
}