稀疏性与量化的有效相互作用:从理论到实践
机器学习
2025-01-29 v2 人工智能
摘要
深度神经网络(DNN)规模的不断增长需要有效的模型压缩,以减少其计算和内存占用。稀疏化和量化是两种突出的压缩方法,已被证明能在保持模型精度的同时显著减少DNN的计算和内存占用。然而,当这两种方法结合使用时,它们如何相互作用仍是开发者面临的关键问题,因为许多人默认它们是正交的,这意味着它们的组合使用不会引入超出各自方法独立引入的额外误差。在本文中,我们首次从数学上证明了稀疏化和量化是非正交的。我们通过涵盖一系列大型语言模型(包括OPT和LLaMA模型家族,参数规模从125M到8B)以及视觉模型(如ViT和ResNet)的实验来佐证这些结果。我们表明,应用这些方法的顺序很重要,因为在稀疏化之前应用量化可能会破坏张量元素的相对重要性,从而无意中移除张量中的重要元素。更重要的是,我们表明,即使按正确顺序应用,稀疏化和量化产生的复合误差也会显著损害精度。我们的发现可扩展到资源受限计算平台上大型模型的高效部署,以降低服务成本,为应用这些压缩方法以在不牺牲精度的情况下最大化硬件资源效率提供最佳实践见解。
引用
@article{arxiv.2405.20935,
title = {Effective Interplay between Sparsity and Quantization: From Theory to Practice},
author = {Simla Burcu Harma and Ayan Chakraborty and Elizaveta Kostenok and Danila Mishin and Dongho Ha and Babak Falsafi and Martin Jaggi and Ming Liu and Yunho Oh and Suvinay Subramanian and Amir Yazdanbakhsh},
journal= {arXiv preprint arXiv:2405.20935},
year = {2025}
}