社会偏见探测:语言模型的公平性基准测试
计算与语言
2025-05-27 v4
摘要
尽管语言模型中社会偏见的影响已得到认可,但现有的偏见评估方法局限于小规模数据集上的二元关联测试,限制了我们对偏见复杂性的理解。本文提出了一种通过评估差别待遇来探测语言模型社会偏见的新框架,差别待遇指根据个体所属敏感人口群体的不同而对他们进行区别对待。我们构建了 SoFa,一个旨在解决现有公平性数据集局限性的大规模基准。SoFa 将分析从刻板身份与非刻板身份的二元对比扩展到涵盖多样化的身份与刻板印象。将我们的方法与现有基准进行比较,我们发现语言模型中的偏见比已认知的更为微妙,表明其中编码的偏见范围比先前所认识到的更广。在 SoFa 上对语言模型进行基准测试,我们揭示了表达不同宗教的身份在所有模型中导致了最显著的差别待遇。最后,我们的研究结果表明,女性和残障人士等各类群体在现实生活中面临的困境在这些模型的行为中得到了映射。
引用
@article{arxiv.2311.09090,
title = {Social Bias Probing: Fairness Benchmarking for Language Models},
author = {Marta Marchiori Manerba and Karolina Stańczak and Riccardo Guidotti and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2311.09090},
year = {2025}
}