StableGrad:无需批归一化的反向尺度控制
机器学习
2026-05-20 v1 人工智能
摘要
训练极深的神经网络需要控制幅度在深度上的传播。没有这种控制,激活值和梯度可能会消失、爆炸或进入不稳定的状态,导致优化失败。现代架构通常通过批归一化、残差连接或其他归一化层来缓解这个问题,这些层反复重新缩放或绕过中间表示。然而,这些机制并不总是适用。在物理信息神经网络 (PINNs) 中,网络表示一个连续的物理场,其输入导数定义了训练目标,这使得依赖于批次的归一化变得有问题,因为它可能会在预测场及其导数中引入非局部依赖。我们提出了 StableGrad,这是一种优化器级别的尺度控制机制,可以在不修改前向模型的情况下纠正逐层权重梯度的不平衡。由于归一化仅在反向传播之后、优化器更新之前应用,因此网络输出、其导数以及物理残差保持不变。我们分析了这种重新缩放所诱导的有效训练动力学,并在深度 PINNs 上评估了 StableGrad 作为目标应用,同时使用无批归一化的卷积网络作为诊断性压力测试。在 PINN 基准测试中,StableGrad 提高了匹配深度的求解精度,并使更深的模型在标准优化下更加可靠。在 ResNet 和 EfficientNet 架构上,移除批归一化通常会导致训练崩溃,而 StableGrad 在不引入任何其他架构更改的情况下稳定了优化。这些结果表明,当前向归一化不可用或不可取时,优化器级别的权重梯度尺度控制可以提供一种实用的替代方案。
引用
@article{arxiv.2605.19856,
title = {StableGrad: Backward Scale Control without Batch Normalization},
author = {Jose I. Mestre and Alberto Fernández-Hernández and Cristian Pérez-Corral and Manuel F. Dolz and Enrique S. Quintana-Ortí},
journal= {arXiv preprint arXiv:2605.19856},
year = {2026}
}