精调的大语言模型是“时间胶囊”,用于跟踪通过书籍了解的社会偏见
计算与语言
2025-02-14 v2
摘要
书籍虽然常富含文化洞见,也可能反映其时代的社会偏见,大型语言模型(LLM)在训练期间可能学习并延续这些偏见。我们引入一种新方法来追踪和量化这些偏见。我们开发 BookPAGE,一个包含 593 本跨七个年代(1950-2019)的虚构书籍语料库,用于跟踪偏见演变。通过在每个年代的书籍上微调 LLM,并使用针对性提示,我们检验关于性别、性取向、种族和宗教的偏见变化。我们的发现表明,训练于特定年代书籍的 LLM 展现出其时代特征的偏见,包括渐进趋势和显著变化。例如,模型响应显示女性在领导角色中的呈现比例从 1950 年代的 8% 增加到 2010 年代的 22%,其中 1990 年代的显著上升从 4% 增至 12%,可能与第三波女权主义相吻合。同性关系的引用从 1980 年代的 0% 明显增加到 2000 年代的 10%,反映了 LGBTQ+ 可见性的提升。令人关切的是,伊斯兰教的负面呈现在 2000 年代急剧上升(从 26% 增至 38%),可能反映了 9/11 后的情绪。重要的是,我们表明这些偏见主要来自书籍内容,而非模型架构或初始训练。我们的研究通过桥接 AI、文学研究和社会科学研究,提供了一种新的社会偏见趋势视角。
引用
@article{arxiv.2502.05331,
title = {Fine-Tuned LLMs are "Time Capsules" for Tracking Societal Bias Through Books},
author = {Sangmitra Madhusudan and Robert Morabito and Skye Reid and Nikta Gohari Sadr and Ali Emami},
journal= {arXiv preprint arXiv:2502.05331},
year = {2025}
}
备注
9 pages (excluding references), accepted to NAACL 2025