中文

pQuant: 面向低位宽语言模型的解耦线性量化感知训练方法

机器学习 2026-02-27 v1 计算与语言

摘要

从零开始的量化感知训练(Quantization-Aware Training)已成为构建高效大语言模型(LLM)的热门方法,能够实现极低位宽权重(低于2位)的部署,为边缘设备提供显著优势。然而,现有方法仍未达到令人满意的精度和可扩展性。在本工作中,我们识别出参数民主化效应(parameter democratization effect)作为关键瓶颈:所有参数的敏感性趋于均匀,严重限制了模型的表达能力。为此,我们提出了pQuant方法,通过将线性层分解为两个专门分支来实现参数解耦:一个用于高效计算的主导1位分支,以及专为保留最敏感参数而设计的紧凑高精度分支。通过定制化的特征缩放,显式引导模型将敏感参数分配到高精度分支。进一步,我们将该分支扩展为多个稀疏激活的专家,从而实现高效的容量扩展。大量实验表明,pQuant在极低位宽量化场景下实现了最先进的性能。

关键词

引用

@article{arxiv.2602.22592,
  title  = {pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training},
  author = {Wenzheng Zhang and Bingzheng Liu and Yang Hu and Xiaoying Bai and Wentao Zhang and Bin Cui},
  journal= {arXiv preprint arXiv:2602.22592},
  year   = {2026}
}

备注

10 pages, 7 figures