批归一化的理论洞察:正则化率的数据依赖自动调优
机器学习
2022-10-19 v2 机器学习
摘要
批归一化(Batch Normalization, BN)被广泛用于深度学习中以归一化中间激活值。深度网络存在众所周知的训练复杂度增加问题,需要对权重进行谨慎初始化、采用较低学习率等。这些问题已通过批归一化(BN)得到缓解,其将激活的输入归一化为零均值和单位标准差。将批归一化作为训练过程的一部分,极大地加速了极深网络的训练过程。一个新兴的研究领域正在探讨 BN 成功背后的确切理论解释。这些理论洞察大多试图通过将 BN 的好处归于其对优化、权重尺度不变性和正则化的影响来解释。尽管 BN 在加速泛化方面取得了不可否认的成功,但将 BN 的效果与正则化参数进行解析关联的研究仍然存在空白。本文旨在通过解析证明揭示 BN 对正则化参数的数据依赖自动调优。我们将 BN 表述为对非 BN 权重施加的约束优化,并由此展示其对正则化参数的依赖于数据统计的自动调优。我们还给出了其在噪声输入场景下行为的解析证明,揭示了正则化参数的信号与噪声调优。我们也通过 MNIST 数据集实验的实证结果支撑了我们的主张。
引用
@article{arxiv.2209.07587,
title = {Theoretical Insight into Batch Normalization: Data Dependant Auto-Tuning of Regularization Rate},
author = {Lakshmi Annamalai and Chetan Singh Thakur},
journal= {arXiv preprint arXiv:2209.07587},
year = {2022}
}