中文

通过分离批归一化模型中的变异模式加速训练

机器学习 2018-11-16 v2 计算机视觉与模式识别 机器学习

摘要

批归一化(BN)对于有效训练最先进的深度卷积神经网络(CNN)至关重要。它在训练期间使用每个小批量的统计信息对各层输入进行归一化。在这项工作中,我们从 Fisher 核的角度研究 BN。我们表明,假设小批量内的样本来自同一概率密度函数,则 BN 等同于高斯分布的 Fisher 向量。这意味着 BN 可以用自然产生于底层数据分布概率密度函数的核来解释。然而,鉴于 CNN 架构中采用的整流非线性,各层输入的分布表现出重尾和非对称特征。因此,我们提出用多个而非一个高斯密度来近似底层数据分布。推导高斯混合模型(GMM)的 Fisher 向量揭示,BN 可以通过针对解耦子总体的统计信息独立归一化来改进。我们将提出的 BN 软分段版本称为混合归一化(MN)。通过在 CIFAR-10 和 CIFAR-100 上广泛的实验,我们表明 MN 不仅有效加速了图像分类和生成对抗网络(GAN)的训练,而且达到了更高质量的模型。

关键词

引用

@article{arxiv.1806.02892,
  title  = {Training Faster by Separating Modes of Variation in Batch-normalized Models},
  author = {Mahdi M. Kalayeh and Mubarak Shah},
  journal= {arXiv preprint arXiv:1806.02892},
  year   = {2018}
}