中文

量化会破坏对齐:压缩LLM中偏见的显现

机器学习 2026-05-18 v1 人工智能

摘要

大型语言模型通常通过后训练量化进行压缩,以降低云端和边缘部署的推理成本和内存占用,但这种压缩对模型质量的影响仍不完全了解。现有研究通常仅比较两种条件(全精度 vs. 单个量化变体),依赖综合偏见指标,并评估单个模型家族,无法区分渐进式退化与阈值依赖的安全失效。我们对三种指令调优模型(Qwen2.5-7B、Mistral-7B、Phi-3.5-mini)在五个精度水平(BF16至3位)上的量化进行受控实证研究,涵盖12,148个BBQ偏见基准项目,包含5个随机种子,总计911,100条推理记录。我们的结果表明,3位量化会导致先前无偏项目的6-21% developing new stereotypical behaviors,呈清晰的剂量-反应模式,通过逻辑回归验证;同时,模型选择“未知”答案的意愿下降17.4%。关键的是,项目层面的这些变化在标准质量指标中完全不可见:在三个模型上,8位量化下的困惑度增加不到0.5%,4位量化下不足3%,但4位量化即可导致2.5-5.6%的项目开发新偏见。这些发现表明,综合评估指标系统性地遗漏了公平性关键退化,凸显了在部署前需明确测试偏见显现的质量感知压缩协议的必要性。

关键词

引用

@article{arxiv.2605.15208,
  title  = {Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels},
  author = {Plawan Kumar Rath and Rahul Maliakkal},
  journal= {arXiv preprint arXiv:2605.15208},
  year   = {2026}
}

备注

7 pages, 4 figures, 4 tables. Accepted at IEEE Cloud Summit 2026. This is the author's accepted version; the version of record will appear in IEEE Xplore