中文

加速批归一化训练:一种流形视角

机器学习 2022-06-07 v3

摘要

批归一化(BN)已成为各类深度神经网络中的关键组件。带 BN 的网络对正线性重缩放变换具有不变性,这使得存在无限多个权重尺度不同但功能等价的网络。然而,使用随机梯度下降等一阶方法优化这些等价网络会得到一系列收敛到不同局部最优解的迭代,原因在于训练过程中它们的梯度不同。为避免此问题,我们提出一个商流形——PSI 流形,其中带 BN 网络的所有等价权重被视为同一元素。接着,我们在所提 PSI 流形上构造梯度下降与随机梯度下降来训练带 BN 的网络。这两种算法保证每一组等价权重(由正重缩放引起)收敛到等价最优解。此外,我们给出了所提算法在 PSI 流形上的收敛速率。结果表明,与欧几里得权重空间上的算法相比,我们的方法加速了训练。最后,经验结果验证了在各种实验设置下,我们的算法在收敛速率与泛化能力上均持续优于现有方法。

关键词

引用

@article{arxiv.2101.02916,
  title  = {Accelerating Training of Batch Normalization: A Manifold Perspective},
  author = {Mingyang Yi},
  journal= {arXiv preprint arXiv:2101.02916},
  year   = {2022}
}

备注

Published in UAI 2022