理解批归一化
机器学习
2018-12-03 v4 人工智能
机器学习
摘要
批归一化 是一种在深度神经网络中间层归一化激活值的技术。其提升准确率和加速训练的趋势已使 BN 成为深度学习中备受青睐的技术。然而,尽管取得了巨大成功,对于这些改进背后的确切原因和机制仍鲜有共识。本文采用经验方法,朝着更好地理解 BN 迈出了一步。我们进行了多项实验,表明 BN 主要使采用更大学习率的训练成为可能,这正是更快收敛和更好泛化的原因。对于没有 BN 的网络,我们展示了过大的梯度更新如何导致损失发散以及激活值随网络深度不受控地增长,从而限制了可用的学习率。BN 通过不断将激活值校正为零均值和单位标准差来避免此问题,这使得更大的梯度步长成为可能,产生更快的收敛,并可能有助于绕过尖锐的局部极小值。我们进一步展示了未归一化的深度网络的梯度和激活值表现异常的多种方式。我们将我们的结果与随机矩阵理论的最新发现进行对比,为经典初始化方案及其后果提供了新的见解。
引用
@article{arxiv.1806.02375,
title = {Understanding Batch Normalization},
author = {Johan Bjorck and Carla Gomes and Bart Selman and Kilian Q. Weinberger},
journal= {arXiv preprint arXiv:1806.02375},
year = {2018}
}