中文

用于模型压缩的旋转不变量化

机器学习 2024-12-03 v3 人工智能 信息论 math.IT

摘要

训练后神经网络(NN)模型压缩是一种有吸引力的方法,用于将大型、高内存消耗的模型部署在内存资源受限的设备上。在本研究中,我们考察了NN模型压缩的率失真权衡。首先,我们提出一种旋转不变量化(RIQ)技术,利用单一参数对整個NN模型进行量化,在各层产生不同码率,即混合精度量化。接着,我们证明该旋转不变方法在压缩意义下是最优的。我们严格评估了RIQ,并展示了其在多种模型和任务上的能力。例如,RIQ在预训练的VGG稠密模型和剪枝模型上分别实现了×19.4\times 19.4×52.9\times 52.9的压缩比,且精度下降<0.4%<0.4\%。代码见\href{https://github.com/ehaleva/RIQ}{github.com/ehaleva/RIQ}。

关键词

引用

@article{arxiv.2303.03106,
  title  = {Rotation Invariant Quantization for Model Compression},
  author = {Joseph Kampeas and Yury Nahshan and Hanoch Kremer and Gil Lederman and Shira Zaloshinski and Zheng Li and Emir Haleva},
  journal= {arXiv preprint arXiv:2303.03106},
  year   = {2024}
}

备注

20 pages, 5 figures