中文

基于投影的权重归一化用于深度神经网络

机器学习 2017-10-09 v1 人工智能 计算机视觉与模式识别

摘要

优化深度神经网络(DNNs)常常受到病态条件问题的困扰。我们观察到,修正非线性网络(rectified nonlinear network)中基于缩放的权重空间对称性属性会导致这一负面效应。因此,我们提议将每个神经元的输入权重约束为单位范数,这被公式化为一个在Oblique流形上的优化问题。我们还开发了一种简单而高效的方法,称为基于投影的权重归一化(PBWN),以解决这个问题。PBWN执行标准梯度更新,随后将更新后的权重投影回Oblique流形。该提出的方法具有正则化特性,并且与常用的批归一化(batch normalization)技术良好协作。我们在几个广泛使用的图像数据集上进行了综合实验,包括CIFAR-10、CIFAR-100、SVHN和ImageNet,用于在最先进的卷积神经网络(如Inception、VGG和残差网络)上进行监督学习。结果表明,我们的方法能够一致地改善不同架构的DNNs的性能。我们还将我们的方法应用于Ladder网络,用于在置换不变MNIST数据集上进行半监督学习,我们的方法优于最先进的方法:仅使用20、50和100个标记样本,我们分别获得了2.52%、1.06%和0.91%的测试错误率。

关键词

引用

@article{arxiv.1710.02338,
  title  = {Projection Based Weight Normalization for Deep Neural Networks},
  author = {Lei Huang and Xianglong Liu and Bo Lang and Bo Li},
  journal= {arXiv preprint arXiv:1710.02338},
  year   = {2017}
}

备注

12 pages, 3 figures