中文

量化如何塑造大型语言模型中的偏见

计算与语言 2026-03-06 v3 机器学习

摘要

本工作对量化对模型偏见影响进行全面评估,特别关注其对各个特定人口统计亚群的影响。我们关注权重和激活量化策略,并检视其在包括刻板印象、公平性、毒性和情感等广泛偏见类型上的效果。我们采用概率和生成文本基准方法,并评估在 13 个基准测试中的模型,这些模型在架构家族和推理能力方面存在差异。我们的发现表明,量化对偏见的影响是细致的:虽然它可以降低模型毒性且不显著影响情感,但倾向于在生成任务中尤其在激进压缩下略微增加刻板印象和不公平感。这些趋势在人口统计类别和亚群以及模型类型之间保持一致,尽管其具体幅度取决于特定环境。总体而言,我们的结果突显了在实际应用中谨慎平衡效率与伦理考量的重要性。

关键词

引用

@article{arxiv.2508.18088,
  title  = {How Quantization Shapes Bias in Large Language Models},
  author = {Federico Marcuzzi and Xuefei Ning and Roy Schwartz and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2508.18088},
  year   = {2026}
}