通过分离批归一化模型中的变异模式加速训练
机器学习
2018-11-16 v2 计算机视觉与模式识别
机器学习
摘要
批归一化(BN)对于有效训练最先进的深度卷积神经网络(CNN)至关重要。它在训练期间使用每个小批量的统计信息对各层输入进行归一化。在这项工作中,我们从 Fisher 核的角度研究 BN。我们表明,假设小批量内的样本来自同一概率密度函数,则 BN 等同于高斯分布的 Fisher 向量。这意味着 BN 可以用自然产生于底层数据分布概率密度函数的核来解释。然而,鉴于 CNN 架构中采用的整流非线性,各层输入的分布表现出重尾和非对称特征。因此,我们提出用多个而非一个高斯密度来近似底层数据分布。推导高斯混合模型(GMM)的 Fisher 向量揭示,BN 可以通过针对解耦子总体的统计信息独立归一化来改进。我们将提出的 BN 软分段版本称为混合归一化(MN)。通过在 CIFAR-10 和 CIFAR-100 上广泛的实验,我们表明 MN 不仅有效加速了图像分类和生成对抗网络(GAN)的训练,而且达到了更高质量的模型。
引用
@article{arxiv.1806.02892,
title = {Training Faster by Separating Modes of Variation in Batch-normalized Models},
author = {Mahdi M. Kalayeh and Mubarak Shah},
journal= {arXiv preprint arXiv:1806.02892},
year = {2018}
}