中文

FAQ:通过家族感知量化重生成校准数据以减轻量化误差

机器学习 2026-01-19 v1 人工智能

摘要

虽然后训练量化 (PTQ) 为在资源受限设备上部署大型语言模型 (LLM) 提供了高效的数值压缩方案,但校准数据的代表性和通用性仍是决定量化参数准确性的核心瓶颈。传统的 PTQ 方法通常依赖有限的样本,难以捕获推理阶段的激活分布,导致量化参数偏差。为此,我们提出了 FAQ (Family-Aware Quantization),一种利用同一家族中 LLM 的先验知识生成高保真校准样本的校准数据重生成框架。具体而言,FAQ 首先将原始校准样本输入来自同一家族中较大 LLM,以生成一系列高保真校准数据。随后,携带链式思维推理并符合预期激活分布的该数据,在专家指导下进行组间竞争,以选择最佳样本,然后进行重新归一化,以增强标准 PTQ 的效果。针对多个模型系列(包括 Qwen3-8B)的实验表明,FAQ 相对于采用原始校准数据的基线方法可减少最高可达 28.5% 的准确度损失,展示了其强大的潜力和贡献。

关键词

引用

@article{arxiv.2601.11200,
  title  = {FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization},
  author = {Haiyang Xiao and Weiqing Li and Jinyue Guo and Guochao Jiang and Guohua Liu and Yuewei Zhang},
  journal= {arXiv preprint arXiv:2601.11200},
  year   = {2026}
}