基于美国劳动力数据的 LLM 职业偏见实证解构
计算与语言
2024-08-28 v2
摘要
大型语言模型(Large Language Models, LLMs)容易继承并放大其训练数据中嵌入的社会偏见,可能加剧与性别、职业及其他敏感类别相关的有害刻板印象。这一问题在偏见的 LLM 可能导致不公平实践并加剧社会不平等的各个领域(如招聘、在线内容 moderation 或甚至刑事司法系统)具有特别问题。尽管 prior research 关注使用旨在突显内在偏见的 specialized 数据集来检测 LLM 中的偏见,但针对权威数据集(如美国国家劳动统计局(NBLS)数据)的研究仍寡言。为填补这一差距,我们进行实证研究,评估 LLM 在"从偏见中脱颖而出”的setting 下的表现,分析生成的输出如何与 NBLS 数据中的分布相匹配。此外,我们提出一种简单而有效的去偏机制,直接整合 NBLS 实例以缓解 LLM 中的偏见。我们的研究涵盖七种不同的 LLM,包括可指令的、基础的和 mixture-of-expert 模型,揭示了常被现有偏见检测技术忽视的显著偏见水平。重要的是,我们的去偏方法不依赖外部数据集,显示出在创建更公平更可靠的 LLM 方面显著降低偏见评分的效果,凸显了该方法的有效性。
引用
@article{arxiv.2408.11247,
title = {Unboxing Occupational Bias: Grounded Debiasing of LLMs with U.S. Labor Data},
author = {Atmika Gorti and Manas Gaur and Aman Chadha},
journal= {arXiv preprint arXiv:2408.11247},
year = {2024}
}
备注
Accepted in AAAI Spring Symposium 2024