中文

剪枝三值量化

计算机视觉与模式识别 2023-07-18 v5 人工智能

摘要

推理时间、模型大小和精度是深度模型压缩的三个关键因素。现有的大多数工作将这三个关键因素分开处理,因为很难同时优化它们。例如,低位量化旨在获得更快的模型;权重共享量化旨在提高压缩比和精度;混合精度量化旨在平衡精度和推理时间。为了同时优化位宽、模型大小和精度,我们提出了剪枝三值量化(PTQ):一种简单、有效的对称三值量化方法。我们将L2归一化、剪枝和权重衰减项整合在一起,以减少量化过程中梯度估计器中的权重差异,从而产生高度压缩的三值权重。我们的方法带来了最高的测试精度和最高的压缩比。例如,它在ImageNet数据集上生成了一个仅降低4%精度的939kb(49倍)2位三值ResNet-18模型。它将170MB的Mask R-CNN压缩至5MB(34倍),平均精度仅下降2.8%。我们的方法在图像分类、目标检测/分割任务上,使用ResNet-18、ResNet-50和MobileNetV2等不同网络结构进行了验证。

关键词

引用

@article{arxiv.2107.10998,
  title  = {Pruning Ternary Quantization},
  author = {Dan Liu and Xi Chen and Jie Fu and Chen Ma and Xue Liu},
  journal= {arXiv preprint arXiv:2107.10998},
  year   = {2023}
}

备注

Merged with Hyperspherical Quantization: Toward Smaller and More Accurate Models (arXiv:2212.12653.)