批量卡尔曼归一化:面向微批量深度神经网络训练
计算机视觉与模式识别
2018-03-01 v2 机器学习
机器学习
摘要
作为不可或缺的组件,批量归一化(BN)通过归一化各隐藏层内部表示的分布,成功改进了采用小批量(mini-batch)的深度神经网络(DNN)训练。然而,在微批量(例如小批量中少于 10 个样本)场景下,BN 的效果会减弱,因为小批量中估计的统计量在样本不足时不可靠。本文提出一种称为批量卡尔曼归一化(BKN)的新归一化方法,用于改进并加速 DNN 的训练,尤其在微批量背景下。具体而言,不同于将各隐藏层视为孤立系统的现有方案,BKN 将网络中全部层视为整体系统,并通过考虑某层所有前驱层的分布来估计该层统计量,模拟卡尔曼滤波的优势。BKN 具有两个引人注目的性质。第一,与先前工作相比,它实现更稳定的训练与更快的收敛。第二,使用 BKN 训练 DNN 的表现明显优于使用 BN 及其变体的情况,尤其在极小小批量时。在 ImageNet 图像分类基准上,使用 BKN 驱动的网络我们改进了最佳已发布模型库结果:InceptionV2 达到 74.0% 的 top-1 验证准确率。更重要的是,使用 BKN 以极小得多的批量取得可比准确率,例如在 CIFAR-10/100 上小 64 倍、在 ImageNet 上小 8 倍。
引用
@article{arxiv.1802.03133,
title = {Batch Kalman Normalization: Towards Training Deep Neural Networks with Micro-Batches},
author = {Guangrun Wang and Jiefeng Peng and Ping Luo and Xinjiang Wang and Liang Lin},
journal= {arXiv preprint arXiv:1802.03133},
year = {2018}
}
备注
We presented how to improve and accelerate the training of DNNs, particularly under the context of micro-batches. (Submitted to IJCAI 2018)