中文

大语言模型显著性感知正则化量化校准

人工智能 2026-05-11 v2 机器学习

摘要

后训练量化(PTQ)是应对大规模语言模型(LLM)内存与延迟限制的有效方法。大多数现有 PTQ 方法通过最小化预定校准数据集上按层重构误差来确定量化参数,通常通过尺度搜索或 Gram 矩阵方法实现。然而,从一般化风险的角度看,基于有限或不具代表性的校准数据的经验重构误差的 PTQ 校准目标可能使量化权重偏离原始浮点权重,潜在降低下游性能。为此,我们提出\emph{正则化量化校准}(Regularized Quantization Calibration, RQC),一个统一框架,通过正则化器显式控制权重偏离原始权重的方式来增强标准 PTQ 目标。我们进一步将该框架推广至显著性感知正则化,形成\emph{显著性感知正则化量化校准}(Saliency-Aware Regularized Quantization Calibration, SARQC)。该正则化鼓励量化权重在校准期间保持接近原始权重,从而在推理时实现更好的泛化。SARQC 可无缝集成到现有 PTQ 流程中,在统一表述下提升基于尺度搜索和基于 Gram 方法的 PTQ 方法,无需引入额外推理开销。广泛实验表明,在稠密和专家稀疏(Mixture-of-Experts)LLM 上,SARQC 在困惑度和零样本准确率方面均实现一致改进。

关键词

引用

@article{arxiv.2605.05693,
  title  = {Saliency-Aware Regularized Quantization Calibration for Large Language Models},
  author = {Yanlong Zhao and Xiaoyuan Cheng and Huihang Liu and Baihua He and Xinyu Zhang and Harrison Bo Hua Zhu and Wenlong Chen and Li Zeng and Zhuo Sun},
  journal= {arXiv preprint arXiv:2605.05693},
  year   = {2026}
}