递减批归一化
机器学习
2019-02-20 v2
摘要
在本论文中,我们提出批归一化(Batch Normalization, BN)算法的一种推广,即递减批归一化(diminishing batch normalization, DBN),其中以递减移动平均的方式更新 BN 参数。BN 在加速神经网络训练阶段收敛方面非常有效,已成为一种常见做法。我们提出的 DBN 算法保持原始 BN 算法的整体结构,同时对某些可训练参数引入加权平均更新。我们提供了 DBN 算法收敛性的分析,证明其收敛到关于可训练参数的驻点。我们的分析可通过将某些参数设为常数而轻易推广到原始 BN 算法。据作者所知,这种针对引入批归一化的收敛性分析尚属首次。我们分析了一个具有任意激活函数的两层模型。该分析的主要挑战在于某些参数通过梯度更新而另一些则不是。该收敛性分析适用于任何满足我们常见假设的激活函数。在数值实验中,我们在具有随机梯度和 ReLU 激活的复杂现代 CNN 模型上测试了所提算法。我们观察到,在 MNIST、NI 和 CIFAR-10 数据集上,使用复杂度合理的 FNN 和 CNN 模型时,DBN 优于原始 BN 算法。
引用
@article{arxiv.1705.08011,
title = {Diminishing Batch Normalization},
author = {Yintai Ma and Diego Klabjan},
journal= {arXiv preprint arXiv:1705.08011},
year = {2019}
}