中文

BitNet:比特正则化的深度神经网络

机器学习 2018-11-20 v3 机器学习

摘要

我们提出了一种用于训练神经网络的全新优化策略,称之为“BitNet”。神经网络的参数通常是无约束的,其动态范围分散在所有实数值上。我们的核心思想是通过动态控制参数可取的范围和值集合来限制网络的表达能力。我们使用一种新颖的端到端方法来表述这一思想,该方法通过优化典型分类损失函数的松弛连续可微上界来规避离散参数空间。该方法可以解释为受最小描述长度(MDL)原理启发的正则化。对于网络的每一层,我们的方法优化实值平移和缩放因子以及任意精度的整数值参数(权重)。我们在 MNIST 和 CIFAR-10 数据集上将 BitNet 与等效的无正则化模型进行了经验比较。我们表明 BitNet 能更快地收敛到更优质量的解。此外,由于使用了整数值参数,所得模型在内存上有显著节省。

关键词

引用

@article{arxiv.1708.04788,
  title  = {BitNet: Bit-Regularized Deep Neural Networks},
  author = {Aswin Raghavan and Mohamed Amer and Sek Chai and Graham Taylor},
  journal= {arXiv preprint arXiv:1708.04788},
  year   = {2018}
}