SocialStigmaQA:揭示生成式语言模型中污名放大的基准
计算与语言
2023-12-29 v4 人工智能
计算机与社会
机器学习
摘要
当前用于审计不良社会偏见的数据集仅限于研究种族和性别等受保护的人口统计特征。在这项工作中,我们引入了一个综合基准,旨在捕捉生成式语言模型中通过污名放大的社会偏见。受社会科学研究的启发,我们从一份包含 93 种以美国为中心的已记录污名列表出发,构建了一个涉及简单社交情境的问答 (QA) 数据集。我们的基准 SocialStigmaQA 包含约 10K 个提示词,具有多种提示词风格,经过精心构建以系统地测试社会偏见和模型鲁棒性。我们展示了两个开源生成式语言模型在 SocialStigmaQA 上的结果,发现在多种解码策略和提示词风格下,社会偏见输出的比例在 45% 到 59% 之间。我们证明,基准中模板的刻意设计(例如,在提示词中加入带偏见的文本或使用改变指示偏见答案的不同动词)会影响模型生成社会偏见输出的倾向。此外,通过人工评估,我们在生成的思维链输出中发现了从细微偏见到缺乏推理等有问题的模式。警告:本文包含有毒、带有偏见且可能有害的文本示例。
引用
@article{arxiv.2312.07492,
title = {SocialStigmaQA: A Benchmark to Uncover Stigma Amplification in Generative Language Models},
author = {Manish Nagireddy and Lamogha Chiazor and Moninder Singh and Ioana Baldini},
journal= {arXiv preprint arXiv:2312.07492},
year = {2023}
}
备注
AAAI 2024