正则化与重参数化避免 Sigmoid 型网络中的梯度消失
机器学习
2021-06-07 v1 人工智能
机器学习
摘要
深度学习需要若干设计选择,如节点的激活函数以及层的宽度、类型与排布。做出这些选择时的一项考量是梯度消失问题,即算法因梯度过小而陷入次优点的现象。本文在 sigmoid 型激活背景下重审梯度消失问题。我们借助数学论证阐明该现象的两种不同来源,即单个参数过大与跨层效应,并说明两种简单补救手段,即正则化与重缩放。随后我们在实践中展示这两种补救手段的有效性。鉴于梯度消失问题是 tanh 及其他 sigmoid 型激活远不如 relu 型激活流行的主要原因,我们的结果使 sigmoid 型激活重回考量之列。
引用
@article{arxiv.2106.02260,
title = {Regularization and Reparameterization Avoid Vanishing Gradients in Sigmoid-Type Networks},
author = {Leni Ven and Johannes Lederer},
journal= {arXiv preprint arXiv:2106.02260},
year = {2021}
}