中文

AWQ:面向LLM压缩与加速的激活感知权重量化

计算与语言 2026-04-28 v6

摘要

大语言模型(LLMs)已变革众多AI应用。设备端LLM正变得愈发重要:在边缘设备本地运行LLM可降低云计算成本并保护用户隐私。然而,庞大的模型规模与有限的硬件资源带来显著部署挑战。我们提出激活感知权重量化(Activation-aware Weight Quantization, AWQ),一种硬件友好的LLM低比特仅权重量化方法。AWQ发现LLM中并非所有权重同等重要,仅保护1%显著权重即可大幅降低量化误差。为识别显著权重通道,我们应参考激活分布而非权重。为避免硬件低效的混合精度量化,我们从数学上推导:放大显著通道可减小量化误差。AWQ采用等价变换缩放显著权重通道以保护之,缩放因子由离线收集激活统计确定。AWQ不依赖任何反向传播或重建,故可泛化至不同领域与模态而不对校准集过拟合。AWQ在多种语言建模与领域特定基准(编程与数学)上优于现有工作。得益于更好泛化,其对指令微调LM及首次对多模态LM均取得优异量化性能。除AWQ外,我们实现TinyChat,一种为4比特设备端LLM/VLMs量身定制的高效灵活推理框架。借助核融合与平台感知权重打包,TinyChat在桌面与移动GPU上均较Huggingface FP16实现提供超3倍加速,并实现了70B Llama-2模型在移动GPU上的部署。

关键词

引用

@article{arxiv.2306.00978,
  title  = {AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration},
  author = {Ji Lin and Jiaming Tang and Haotian Tang and Shang Yang and Wei-Ming Chen and Wei-Chen Wang and Guangxuan Xiao and Xingyu Dang and Chuang Gan and Song Han},
  journal= {arXiv preprint arXiv:2306.00978},
  year   = {2026}
}

备注

MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq