中文

通过梯度变换实现特征白化以改善收敛性

机器学习 2020-11-10 v2 机器学习

摘要

特征白化是一种已知的加速 DNN 训练的技术。在某些假设下,对激活进行白化可将 Fisher 信息矩阵简化为简单的单位矩阵,此时随机梯度下降等价于更快的自然梯度下降。由于在前向与反向传播中对层输入及其对应梯度进行变换以及反复计算特征值分解(EVD)所带来的额外复杂性,该方法迄今未被普遍使用。在本工作中,我们解决了特征白化的复杂性缺陷。我们的贡献有两点。首先,我们推导了一种等价方法,其将对样本变换替换为对权重梯度的变换,并应用于每批 B 个样本。复杂度降低了 S=(2B) 倍,其中 S 表示层输出的特征维度。随着分布式训练中批大小的增加,使用所提方法的优势变得更加显著。其次,受样本协方差矩阵条件数与收敛速度之间理论关系的启发,我们推导了一种替代的次优算法,其递归地降低后一矩阵的条件数。与 EVD 相比,复杂度降低了输入特征维度 M 倍。我们以基于 ResNet 的网络在 CIFAR 和 Imagenet 数据集上的图像分类为例说明了所提算法。并行化所提算法是直接的,我们实现了其分布式版本。在我们的实验中可观察到收敛速度及所达精度的改善。

关键词

引用

@article{arxiv.2010.01546,
  title  = {Feature Whitening via Gradient Transformation for Improved Convergence},
  author = {Shmulik Markovich-Golan and Barak Battash and Amit Bleiweiss},
  journal= {arXiv preprint arXiv:2010.01546},
  year   = {2020}
}

备注

NeurIPS 2020 Workshop Beyond Backpropagation - Novel Ideas for Training Neural Architectures