大型语言模型中的受保护群体偏见与刻板印象
计算机与社会
2024-03-25 v1 计算与语言
机器学习
摘要
随着现代大型语言模型在各个领域打破了许多 SOTA 基准,本文研究了它们在伦理和公平性领域的行为,重点关注受保护群体偏见。我们进行了一项分为两部分的研究:首先,我们请求模型续写描述来自不同受保护群体(包括性别、性取向、宗教和种族)个体职业的句子。其次,我们让模型生成关于从事不同类型职业个体的故事。我们收集了一个公开可用的 LLM 生成的超过 1 万条句子补全结果,并进行了人工标注。我们在少数群体中发现了偏见,尤其是在性别和性取向领域,以及模型生成内容中的西方偏见。该模型不仅反映了社会偏见,而且似乎放大了这些偏见。此外,模型在回复与少数群体相关的查询时过于谨慎,提供的响应强烈强调多样性和公平性,以至于其他群体特征被掩盖。这表明,人为限制潜在有害输出本身可能导致伤害,应当谨慎且有控制地应用。
引用
@article{arxiv.2403.14727,
title = {Protected group bias and stereotypes in Large Language Models},
author = {Hadas Kotek and David Q. Sun and Zidi Xiu and Margit Bowler and Christopher Klein},
journal= {arXiv preprint arXiv:2403.14727},
year = {2024}
}