比特递减:重新审视神经网络的量化
计算机视觉与模式识别
2020-11-10 v5
摘要
在本文中,我们解决了减小卷积网络架构内存占用的问题。我们引入了一种向量量化方法,旨在保留网络输出而非其权重的重建质量。我们方法的原则是最小化域内输入的重建损失误差。我们的方法在量化时仅需要一组无标签数据,并通过使用字节对齐码本存储压缩权重从而在 CPU 上实现高效推理。我们通过将高性能 ResNet-50 模型量化为 5MB 内存大小(20 倍压缩率)同时在 ImageNet 物体分类上保持 76.1% 的 top-1 准确率,以及将 Mask R-CNN 以 26 倍率压缩,验证了我们的方法。
引用
@article{arxiv.1907.05686,
title = {And the Bit Goes Down: Revisiting the Quantization of Neural Networks},
author = {Pierre Stock and Armand Joulin and Rémi Gribonval and Benjamin Graham and Hervé Jégou},
journal= {arXiv preprint arXiv:1907.05686},
year = {2020}
}
备注
ICLR 2020 camera-ready