向上还是向下?用于训练后量化的自适应舍入
机器学习
2020-07-01 v2 计算机视觉与模式识别
机器学习
摘要
在量化神经网络时,将每个浮点权重赋为其最近的定点值是最主要的方法。我们发现,或许令人惊讶的是,这并非我们能做到的最好方式。本文提出 AdaRound,一种用于训练后量化的更优权重舍入机制,可自适应于数据与任务损失。AdaRound 快速、无需网络微调,且仅使用少量无标签数据。我们首先从理论上分析预训练神经网络的舍入问题。通过用泰勒级数展开近似任务损失,将舍入任务表述为二次无约束二元优化问题。我们将其简化为逐层局部损失,并提议用软松弛优化该损失。AdaRound 不仅以显著优势超越就近舍入,还在多个网络与任务上确立了训练后量化新的最先进(SOTA)水平。无需微调,我们即可将 Resnet18 与 Resnet50 的权重量化至 4 位,同时精度损失保持在 1% 以内。
引用
@article{arxiv.2004.10568,
title = {Up or Down? Adaptive Rounding for Post-Training Quantization},
author = {Markus Nagel and Rana Ali Amjad and Mart van Baalen and Christos Louizos and Tijmen Blankevoort},
journal= {arXiv preprint arXiv:2004.10568},
year = {2020}
}
备注
Published as a conference paper at ICML 2020