用于模型压缩的旋转不变量化
机器学习
2024-12-03 v3 人工智能
信息论
math.IT
摘要
训练后神经网络(NN)模型压缩是一种有吸引力的方法,用于将大型、高内存消耗的模型部署在内存资源受限的设备上。在本研究中,我们考察了NN模型压缩的率失真权衡。首先,我们提出一种旋转不变量化(RIQ)技术,利用单一参数对整個NN模型进行量化,在各层产生不同码率,即混合精度量化。接着,我们证明该旋转不变方法在压缩意义下是最优的。我们严格评估了RIQ,并展示了其在多种模型和任务上的能力。例如,RIQ在预训练的VGG稠密模型和剪枝模型上分别实现了和的压缩比,且精度下降。代码见\href{https://github.com/ehaleva/RIQ}{github.com/ehaleva/RIQ}。
引用
@article{arxiv.2303.03106,
title = {Rotation Invariant Quantization for Model Compression},
author = {Joseph Kampeas and Yury Nahshan and Hanoch Kremer and Gil Lederman and Shira Zaloshinski and Zheng Li and Emir Haleva},
journal= {arXiv preprint arXiv:2303.03106},
year = {2024}
}
备注
20 pages, 5 figures