训练宽残差网络以单比特权重部署
机器学习
2018-02-27 v1 计算机视觉与模式识别
神经与进化计算
机器学习
摘要
为了在资源受限的嵌入式硬件上快速且节能地部署训练好的深度神经网络,每个学习到的权重参数理想情况下应使用单比特表示和存储。当施加此要求时,错误率通常会上升。在此,我们报告了在多个数据集上,以每权重 1 比特部署的深度卷积神经网络错误率的大幅改进。以宽残差网络作为主要基线,我们的方法简化了现有通过训练中应用符号函数对权重二值化的方法;我们对每一层应用缩放因子,其恒定未学习值等于用于初始化的层特定标准差。对于 CIFAR-10、CIFAR-100 和 ImageNet,以及需要少于 10 MB 参数内存的每权重 1 比特模型,我们分别实现了 3.9%、18.5% 和 26.0% / 8.5%(Top-1 / Top-5)的错误率。我们还考虑了 MNIST、SVHN 和 ImageNet32,分别实现了 0.27%、1.9% 和 41.3% / 19.1% 的每权重 1 比特测试结果。对于 CIFAR,我们的错误率减半了先前报告的值,并且与我们相同网络全精度权重的错误率相差约 1%。对于过拟合的网络,我们还展示了通过不学习批归一化缩放和偏移参数在错误率上的显著改进。这适用于全精度和每权重 1 比特网络。使用热重启学习率调度,我们发现每权重 1 比特的训练与全精度网络一样快,且比标准调度具有更好的准确性,并在 CIFAR-10/100 仅 62 个训练周期中达到了约 98%-99% 的峰值性能。有关 MATLAB、Keras 和 PyTorch 中的完整训练代码和训练模型,请参见 https://github.com/McDonnell-Lab/1-bit-per-weight/ 。
引用
@article{arxiv.1802.08530,
title = {Training wide residual networks for deployment using a single bit for each weight},
author = {Mark D. McDonnell},
journal= {arXiv preprint arXiv:1802.08530},
year = {2018}
}
备注
Published as a conference paper at ICLR 2018