中文

超越BatchNorm:迈向深度学习中归一化的统一理解

机器学习 2021-10-27 v4 计算机视觉与模式识别

摘要

受BatchNorm启发,深度学习中归一化层呈爆发式增长。近期工作已识别出BatchNorm的多种有益特性以解释其成功。然而,在追求替代归一化层时,这些特性需要被推广,从而能准确预测任意给定层的成功或失败。本文中,我们通过将随机初始化深度神经网络(DNNs)中BatchNorm的已知特性扩展到若干近期提出的归一化层,朝此目标迈出第一步。我们的主要发现如下:(i) 与BatchNorm类似,基于激活的归一化层可防止ResNets中激活的指数增长,但参数化技术需要显式补救;(ii) 使用GroupNorm可确保信息丰富的正向传播,不同样本被赋予相异激活,但增大组大小会导致不同样本的激活日益不可区分,解释了LayerNorm模型收敛缓慢;(iii) 小组大小导致前层梯度范数较大,由此解释Instance Normalization中的训练不稳定问题,并阐明GroupNorm中的速度-稳定性权衡。总体而言,我们的分析揭示了支撑深度学习中归一化方法成功的一套统一机制,为我们系统探索DNN归一化层的广阔设计空间提供了指南。

关键词

引用

@article{arxiv.2106.05956,
  title  = {Beyond BatchNorm: Towards a Unified Understanding of Normalization in Deep Learning},
  author = {Ekdeep Singh Lubana and Robert P. Dick and Hidenori Tanaka},
  journal= {arXiv preprint arXiv:2106.05956},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021