统一分块后训练量化与蒸馏量化感知训练:面向2位指令微调大语言模型的渐进量化
机器学习
2025-06-12 v1 人工智能
摘要
随着大型语言模型(LLMs)的快速扩展对资源受限设备的部署构成重大挑战,人们对极低比特量化(如2比特)产生了日益浓厚的兴趣。尽管先前工作已表明2比特大型模型在准确率和延迟方面均优于其4比特小型对应模型,但这些进展仅限于预训练LLMs,尚未扩展到指令微调模型。为弥合这一差距,我们提出了统一渐进量化(UPQ)——一种新颖的渐进量化框架(FP16→INT4→INT2),将分块后训练量化(PTQ)与基于蒸馏的量化感知训练(Distill-QAT)统一起来,用于INT2指令微调LLM量化。UPQ首先使用分块PTQ将FP16指令微调模型量化为INT4,以显著减小后续INT2量化引入的量化误差。接下来,UPQ应用Distill-QAT,通过最小化两者之间的广义Jensen-Shannon散度(JSD),使INT2指令微调LLM能够生成与其原始FP16对应模型一致的响应。据我们所知,我们是第一个证明UPQ可以在不依赖专有后训练数据的情况下将开源指令微调LLM量化为INT2,同时在MMLU和IFEval上取得最先进性能——这两个是评估指令微调LLM最具代表性的基准。
引用
@article{arxiv.2506.09104,
title = {Unifying Block-wise PTQ and Distillation-based QAT for Progressive Quantization toward 2-bit Instruction-Tuned LLMs},
author = {Jung Hyun Lee and Seungjae Shin and Vinnam Kim and Jaeseong You and An Chen},
journal= {arXiv preprint arXiv:2506.09104},
year = {2025}
}
备注
Preprint