批归一化解析
机器学习
2022-09-30 v1 人工智能
计算几何
计算机视觉与模式识别
机器学习
摘要
现代深度网络(DN)中一个至关重要、无处不在却鲜被理解的成分是批归一化(BN),它对特征图进行中心化与归一化。迄今为止,在理解 BN 为何提升 DN 学习与推断性能方面仅取得有限进展;已有工作仅专注于表明 BN 平滑了 DN 的损失景观。本文从函数逼近的视角对 BN 进行理论研究;我们利用当今多数最先进 DN 均为连续分段仿射(CPA)样条的事实,这些样条通过定义在输入空间划分(所谓“线性区域”)上的仿射映射将预测器拟合到训练数据。{\em 我们证明 BN 是一种无监督学习技术,它——独立于 DN 的权重或基于梯度的学习——使 DN 的样条划分几何适配数据。} BN 提供了“智能初始化”从而提升 DN 学习性能,因为它甚至能将随机初始化权重的 DN 适配为使其样条划分与数据对齐。我们还表明,小批量之间 BN 统计量的变化给划分边界乃至分类问题的决策边界引入了类 dropout 的随机扰动。这种逐小批量的扰动通过增大训练样本与决策边界之间的间隔来减少过拟合并改善泛化。
引用
@article{arxiv.2209.14778,
title = {Batch Normalization Explained},
author = {Randall Balestriero and Richard G. Baraniuk},
journal= {arXiv preprint arXiv:2209.14778},
year = {2022}
}