即便有偏差:大语言模型在社会维度上的公平性检验
计算与语言
2025-02-19 v2
摘要
本文系统性地分析了开源大型语言模型(LLM)在性别、宗教和种族等社会维度上的偏见。我们采用包含五种不同偏见触发器(General Debate、Positioned Debate、Career Advice、Problem Solving 和 CV Generation)的 SALT(Social Appropriateness in LLM-Generated Text)数据集,对较小规模的 Llama 和 Gemma 模型进行偏见评估。为量化偏见,我们测量 General Debate 中的胜率以及 Positioned Debate 中负面角色的分配情况。对于职业建议、问题解决和简历生成等实际应用场景,我们对输出进行匿名化处理,以去除显性人口统计信息,并使用 DeepSeek-R1 作为自动评估器。我们还解决了 LLM 基于评估中固有的偏见问题,包括评估偏见、位置偏见和长度偏见,并通过人类评估验证了结果。我们的发现表明,各模型之间存在持续的偏差化倾向,某些人口统计群体接收到的待遇系统性地偏向或不利。通过引入 SALT,我们提供了全面的偏见分析基准,强调在开发公平 AI 系统时需要完善的偏见缓解策略。
引用
@article{arxiv.2410.12499,
title = {With a Grain of SALT: Are LLMs Fair Across Social Dimensions?},
author = {Samee Arif and Zohaib Khan and Maaidah Kaleem and Suhaib Rashid and Agha Ali Raza and Awais Athar},
journal= {arXiv preprint arXiv:2410.12499},
year = {2025}
}