中文

基于经典自适应滤波理论分离批归一化对 CNN 训练速度与稳定性的影响

神经与进化计算 2021-06-02 v2 机器学习 信号处理

摘要

批归一化(BatchNorm)常用于卷积神经网络(CNNs)以提升训练速度与稳定性。然而,关于该技术为何有效仍缺乏共识。本文借助传统自适应滤波领域的概念,揭示 BatchNorm 的动力学与内部机制。首先,我们证明卷积权重的更新具有自然模式,其稳定性与收敛速度依赖于输入自相关矩阵的特征值,而后者由 BatchNorm 经由卷积层的通道级结构所控制。此外,我们的实验表明速度与稳定性收益是两种不同的效应:在低学习率下,正是 BatchNorm 对最小特征值的放大改善了收敛速度;而在高学习率下,正是 BatchNorm 对最大特征值的抑制保证了稳定性。最后,我们证明在首个训练步(最需归一化时),BatchNorm 满足与归一化最小均方(NLMS)相同的优化,且在后续步骤中持续逼近该条件。本文所给分析为进一步利用自适应滤波理论深入理解现代神经网络结构运作奠定基础。

关键词

引用

@article{arxiv.2002.10674,
  title  = {Separating the Effects of Batch Normalization on CNN Training Speed and Stability Using Classical Adaptive Filter Theory},
  author = {Elaina Chai and Mert Pilanci and Boris Murmann},
  journal= {arXiv preprint arXiv:2002.10674},
  year   = {2021}
}

备注

Presented at Asilomar Conference on Signals, Systems, and Computers, 2020