中文

用于记忆化批归一化的双重前向传播

机器学习 2020-10-13 v1 计算机视觉与模式识别

摘要

批归一化(BN)已成为设计深度神经网络(DNNs)的标准组件。尽管标准 BN 能显著加速 DNN 训练并提升泛化性能,但其存在一些潜在局限,可能妨碍训练与推理阶段的性能。在训练阶段,BN 依赖使用单个小批量估计数据的均值和方差。因此,当批量大小非常小或数据采样不佳时,BN 会不稳定。在推理阶段,BN 常使用所谓的移动均值和移动方差代替批量统计量,即 BN 的训练与推理规则并不一致。针对这些问题,我们提出记忆化批归一化(MBN),其考虑多个近期批次以获得更准确且鲁棒的统计量。注意,在每个批次的 SGD 更新之后,模型参数会改变,特征也随之改变,导致所考虑批次更新前后出现分布偏移。为缓解此问题,我们在 MBN 中提出一种简单的双重前向(Double-Forward)方案,可进一步提升性能。与相关方法相比,所提出的 MBN 在训练与推理中表现出一致的行为。实证结果表明,采用双重前向方案训练的基于 MBN 的模型大幅降低了对数据的敏感性并显著改善了泛化性能。

关键词

引用

@article{arxiv.2010.04947,
  title  = {Double Forward Propagation for Memorized Batch Normalization},
  author = {Yong Guo and Qingyao Wu and Chaorui Deng and Jian Chen and Mingkui Tan},
  journal= {arXiv preprint arXiv:2010.04947},
  year   = {2020}
}

备注

AAAI2018, 8 pages, 3 figures