多奖彩票假设:通过剪枝随机加权网络寻找精确二值神经网络
机器学习
2021-03-18 v1 计算机视觉与模式识别
摘要
最近,Frankle & Carbin(2019)证明随机初始化的稠密网络包含子网络,一旦找到,训练后可达与训练稠密网络相当的测试精度。然而,寻找这些高性能可训练子网络代价高昂,需要训练和剪枝权重的迭代过程。在本文中,我们提出(并证明)一个更强的多奖彩票假设:具有随机权重的充分过参数化神经网络包含若干子网络(中奖票),它们(a)具有与具有学习权重的稠密目标网络相当的精度(奖 1),(b)不需要任何进一步训练即可获得奖 1(奖 2),以及(c)对极端形式的量化(即二值权重和/或激活)具有鲁棒性(奖 3)。这提供了一种通过学习紧凑且高精度的二值神经网络的新范式,仅需剪枝和量化随机加权的全精度神经网络。我们还提出了一种寻找多奖票(MPTs)的算法,并在 CIFAR-10 和 ImageNet 数据集上通过一系列实验进行测试。实证结果表明,随着模型变得更深更宽,多奖票开始达到与其显著更大且全精度的权重训练对应网络相似(有时甚至更高)的测试精度。在不更新权重值的情况下,我们的 MPTs-1/32 不仅刷新了二值权重网络的最先进(SOTA)Top-1 精度——CIFAR-10 上 94.8%,ImageNet 上 74.03%——而且分别超越其全精度对应网络 1.78% 和 0.76%。此外,我们的 MPT-1/1 在 CIFAR-10 上实现了二值神经网络的 SOTA Top-1 精度(91.9%)。代码和预训练模型可在:https://github.com/chrundle/biprop 获取。
引用
@article{arxiv.2103.09377,
title = {Multi-Prize Lottery Ticket Hypothesis: Finding Accurate Binary Neural Networks by Pruning A Randomly Weighted Network},
author = {James Diffenderfer and Bhavya Kailkhura},
journal= {arXiv preprint arXiv:2103.09377},
year = {2021}
}