中文

量化大语言模型中的不确定性驱动社会偏见变化

计算与语言 2026-02-09 v1

摘要

后训练量化会降低大语言模型的计算成本,但从根本上改变了其社会偏见,传统聚合指标未能捕捉这一变化。我们提出了首个针对 50 个量化模型的大规模研究,这些模型在 PostTrainingBiasBench 上评估——这是一套统一的包含 13 个封闭式和开放式偏见数据集的基准。我们识别出一种称为量化诱导的掩码偏见翻转(quantization-induced masked bias flipping)的现象,量化后最多有 21% 的响应在聚合偏见分数未变的情况下会在有偏和无偏状态之间翻转。这些翻转严格由模型不确定性驱动,响应不确定性高的样本比确定性样本高 3-11 倍更可能发生变化。量化强度放大了这一效应,4 位量化模型比 8 位量化模型展现出 4-6 倍的行为变化。关键的是,这些变化在不同人口统计学群体之间产生不对称影响,其中某些群体的偏见可能恶化最高达 18.6%,而另一些群体则改善最高达 14.1%,导致误性地中性化聚合结果。更大的模型没有表现出一致的鲁棒优势,群体特定的偏移在不同模型家族中呈现不可预测变化。我们的发现表明,压缩从根本上改变了偏见模式,需对量化后的模型进行关键事后评估和干预,以确保实际应用中的可靠性。

关键词

引用

@article{arxiv.2602.06181,
  title  = {Uncertainty Drives Social Bias Changes in Quantized Large Language Models},
  author = {Stanley Z. Hua and Sanae Lotfi and Irene Y. Chen},
  journal= {arXiv preprint arXiv:2602.06181},
  year   = {2026}
}

备注

12 pages, 6 figures