中文

深度神经网络容量

计算机视觉与模式识别 2018-02-20 v3

摘要

近年来,深度神经网络在许多计算机视觉应用中展现出其强大的信息判别优势。然而,深度神经网络架构的容量对研究人员来说仍然是一个谜。直觉上,更大的神经网络容量总是可以存储更多信息,从而提高模型的判别能力。但是,可学习参数的规模并不可行于估计深度神经网络的容量。由于过拟合,直接增加隐藏节点数和隐藏层数已被证明并不必然能有效提高网络的判别能力。在本文中,我们提出了一种名为“总有效位”的新度量,以评估深度神经网络的容量,旨在探索如何定量理解深度学习及其卓越性能背后的洞见。具体而言,我们提取总有效位的方案结合了训练阶段和推理阶段的熟练技术。在网络训练中,我们设计了十进制权重正则化和 8 位前向量化,以获得面向整数的网络表示。此外,我们在推理阶段开发了自适应位宽和非均匀量化策略,以寻找神经网络的容量,即总有效位。通过允许零位宽,我们的自适应位宽量化可以同时执行模型缩减和有效位寻找。在我们广泛的实验中,我们首先证明我们的总有效位是神经网络容量的良好指标。我们还分析了网络架构和高级训练技巧(如 dropout 和 batch normalization)对网络容量的影响。

关键词

引用

@article{arxiv.1708.05029,
  title  = {Deep Neural Network Capacity},
  author = {Aosen Wang and Hua Zhou and Wenyao Xu and Xin Chen},
  journal= {arXiv preprint arXiv:1708.05029},
  year   = {2018}
}

备注

There is an error in Average Valid Bits computation in figure 1 in page 2