探索小型语言模型后训练量化中的层级信息有效性
机器学习
2025-12-30 v2 人工智能
摘要
拥有数十亿参数的大型语言模型往往资源过度配置:许多层贡献的唯一信息有限,却在推理期间占据主要的内存和能源占比。我们提出了 LieQ Layer-wise information effectiveness Quantization,即一种面向小型语言模型的硬件原生、基于指标驱动的后训练量化框架,旨在解决在参数小于 80 亿 (sub-8B) 的模型在极端低位压缩下保持准确性的关键挑战。LieQ 在每个层内保持统一的位宽,但跨层混合精度,保留标准的乘法内核,避免在推理时出现不规则的内存访问、codebook 或不规则格式。我们的方法揭示了层级功能显著性与表征紧凑性之间存在强烈相关性,表明具有更高训练引起能量浓度的层在功能上是不可替代的。基于这一洞见,我们提出了一种纯粹基于几何驱动的灵敏度代理,使我们能够在目标平均位宽预算下进行自动位宽分配,而无需进行昂贵的梯度更新或基于推理的困惑度探测。在低于 2 位的情况下,LieQ 在 Qwen3 和 LLaMA3.x 系列模型上持续减少相对于天真 2 位基线通常看到的较大准确性差距,同时保持标准内核效率。这些特性使得 LieQ 成为将小型语言模型部署到资源受限边缘设备的实用路径。代码将在 https://github.com/HeXiao-55/LieQ-official.git 提供。
引用
@article{arxiv.2508.03332,
title = {Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models},
author = {He Xiao and Qingyao Yang and Dirui Xie and Wendong Xu and Zunhai Su and Runming yang and Wenyong Zhou and Haobo Liu and Zhengwu Liu and Ngai Wong},
journal= {arXiv preprint arXiv:2508.03332},
year = {2025}
}
备注
low-bit quantization