AdpQ:一种无校准自适应后训练量化方法用于大语言模型
计算与语言
2024-05-24 v1
摘要
大型语言模型(LLM)的计算复杂度不断增长, necessitating 高效部署策略。当前最先进的后训练量化(PTQ)方法通常需要校准才能实现所需精度。本文提出AdpQ,一种 novel zero-shot adaptive PTQ 方法,用于LLM,在不要求任何校准数据的情况下实现了低精度量化(例如3位)的国家水平性能。灵感来自自适应LASSO回归模型,我们的方法通过自适应软阈值方法分离显著权重来解决异常激活的挑战。受自适应LASSO指导,该方法确保量化权重分布与原训练权重 closely follow,完全消除对校准数据的需求,使其区别于SpQR和AWQ等流行方法。此外,本方法还在隐私保护方面提供了额外益处,通过消除任何校准或训练数据实现。我们更深入地探讨了本方法的信息论底层。我们展示,它利用自适应LASSO来最小化量化权重与原训练权重之间的库克-朗伯散度。这一最小化确保量化模型保留了原始模型在很大程度上上的香农信息内容,保证在不牺牲准确性或信息的情况下实现高效部署。我们的结果在各种LLM基准测试中实现了与现有方法相同的准确性,而量化时间至少缩短了10倍,巩固了我们在高效和隐私保护LLM部署方面的贡献。
引用
@article{arxiv.2405.13358,
title = {AdpQ: A Zero-shot Calibration Free Adaptive Post Training Quantization Method for LLMs},
author = {Alireza Ghaffari and Sharareh Younesian and Vahid Partovi Nia and Boxing Chen and Masoud Asgharian},
journal= {arXiv preprint arXiv:2405.13358},
year = {2024}
}