基于投影的权重归一化用于深度神经网络
机器学习
2017-10-09 v1 人工智能
计算机视觉与模式识别
摘要
优化深度神经网络(DNNs)常常受到病态条件问题的困扰。我们观察到,修正非线性网络(rectified nonlinear network)中基于缩放的权重空间对称性属性会导致这一负面效应。因此,我们提议将每个神经元的输入权重约束为单位范数,这被公式化为一个在Oblique流形上的优化问题。我们还开发了一种简单而高效的方法,称为基于投影的权重归一化(PBWN),以解决这个问题。PBWN执行标准梯度更新,随后将更新后的权重投影回Oblique流形。该提出的方法具有正则化特性,并且与常用的批归一化(batch normalization)技术良好协作。我们在几个广泛使用的图像数据集上进行了综合实验,包括CIFAR-10、CIFAR-100、SVHN和ImageNet,用于在最先进的卷积神经网络(如Inception、VGG和残差网络)上进行监督学习。结果表明,我们的方法能够一致地改善不同架构的DNNs的性能。我们还将我们的方法应用于Ladder网络,用于在置换不变MNIST数据集上进行半监督学习,我们的方法优于最先进的方法:仅使用20、50和100个标记样本,我们分别获得了2.52%、1.06%和0.91%的测试错误率。
引用
@article{arxiv.1710.02338,
title = {Projection Based Weight Normalization for Deep Neural Networks},
author = {Lei Huang and Xianglong Liu and Bo Lang and Bo Li},
journal= {arXiv preprint arXiv:1710.02338},
year = {2017}
}
备注
12 pages, 3 figures