偏见能达到什么高度?从预训练数据追踪到对齐过程中的偏见
计算与语言
2026-05-13 v2
摘要
随着大语言模型被越来越多地集成到用户面向的应用中,解决持续制造社会不平等的偏见问题至关重要。虽然已有大量工作致力于衡量或缓解这些模型中的偏见,但少数研究探讨了偏见的来源。因此,本研究考察了预训练数据中性别-职业偏见与其在大语言模型中呈现之间的相关性,具体聚焦Dolma数据集和OLMo模型。通过零样本提示和token共现分析,我们探索了训练数据中的偏见如何影响模型输出。我们的发现表明,预训练数据中存在的偏见在模型输出中被放大。该研究还考察了提示类型、超参数以及指令微调对偏见表达的影响,发现指令微调部分缓解了表征偏见,但仍保持整体的性别刻板印象,而超参数和提示变异对偏见表达的影响较小。我们的研究追踪了整个大语言模型开发管道中的偏见,强调了在预训练阶段减轻偏见的重要性。
引用
@article{arxiv.2411.19240,
title = {How far can bias go? Tracing bias from pretraining data to alignment},
author = {Marion Thaler and Abdullatif Köksal and Alina Leidinger and Anna Korhonen and Hinrich Schütze},
journal= {arXiv preprint arXiv:2411.19240},
year = {2026}
}