中文

迈向无深度限制的训练:无梯度爆炸的批归一化

机器学习 2023-10-04 v1 人工智能

摘要

归一化层是深度神经网络的关键构建模块之一。若干理论研究已表明,批归一化通过避免各层间表示变得共线而改善了信号传播。然而,批归一化的平均场理论结果也得出结论:这一益处是以深度上梯度爆炸为代价的。受批归一化这两个方面的启发,本研究提出如下问题:"批归一化网络能否保持最优信号传播特性,同时避免梯度爆炸?"我们通过给出一个具体的多层感知机(MLP)构造(具有线性激活与批归一化)对此问题给出肯定回答,该构造可证明在任意深度下具有有界梯度。基于 Weingarten 微积分,我们为这一构造的 MLP 发展了一套严格且非渐近的理论,精确刻画了前向信号传播,同时证明了在线性独立输入样本(这在大多数实际设定中成立)下梯度保持有界。受我们的理论启发,我们还设计了一种激活整形方案,在经验上对某些非线性激活实现了相同性质。

关键词

引用

@article{arxiv.2310.02012,
  title  = {Towards Training Without Depth Limits: Batch Normalization Without Gradient Explosion},
  author = {Alexandru Meterez and Amir Joudaki and Francesco Orabona and Alexander Immer and Gunnar Rätsch and Hadi Daneshmand},
  journal= {arXiv preprint arXiv:2310.02012},
  year   = {2023}
}