OutlierTune:面向大语言模型的高效通道级量化
计算与语言
2024-06-28 v1
摘要
对大型语言模型(LLM)激活值的量化长期以来是一个重要挑战,主要由于存在结构化异常值。大多数现有方法侧重于按标记或按张量对激活值进行量化,难以同时实现精度与硬件效率。为此,本文提出了一种名为OutlierTune的高效按通道后训练量化(PTQ)方法,用于LLM的激活值。OutlierTune由两个组件构成:去量化的预执行与数值对称化。去量化的预执行通过激活缩放因子更新模型权重,避免了按通道激活量化所带来的内部缩放及其高额额外计算开销。数值对称化进一步通过确保不同激活通道间的数值范围平衡,减少因权重更新而产生的量化差异。OutlierTune易于实现且硬件高效,在推理过程中几乎没有引入额外的计算开销。广泛的实验表明,所提出的框架在多个不同任务上均优于现有方法。该框架在改进指令调优LLM(如OPT-IML)的Int6量化方面表现出更好的概括性,使其达到半精度(FP16)水平。此外,我们还展示了该框架相较于FP16实现快1.48倍,同时将约减半的内存占用。
引用
@article{arxiv.2406.18832,
title = {OutlierTune: Efficient Channel-Wise Quantization for Large Language Models},
author = {Jinguang Wang and Yuexi Yin and Haifeng Sun and Qi Qi and Jingyu Wang and Zirui Zhuang and Tingting Yang and Jianxin Liao},
journal= {arXiv preprint arXiv:2406.18832},
year = {2024}
}