StereoSet:测量预训练语言模型中的刻板偏见
计算与语言
2020-04-21 v1 人工智能
计算机与社会
摘要
刻板印象是对特定人群的一种过度概括的信念,例如亚洲人擅长数学或亚洲人不擅长驾驶。此类信念(偏见)已知会伤害目标群体。由于预训练语言模型在大规模真实世界数据上训练,它们已知会捕捉刻板偏见。为了评估这些模型的不利影响,量化其中所捕捉的偏见十分重要。现有关于偏见量化的文献在少量人工构建的偏见评估句子上评估预训练语言模型。我们提出 StereoSet,一个大规模的英文自然语言数据集,用于测量四个领域中的刻板偏见:性别、职业、种族和宗教。我们在该数据集上评估了 BERT、GPT-2、RoBERTa 和 XLNet 等流行模型,并表明这些模型表现出强烈的刻板偏见。我们还提供了一个带有隐藏测试集的排行榜,用于在 https://stereoset.mit.edu 上追踪未来语言模型的偏见。
引用
@article{arxiv.2004.09456,
title = {StereoSet: Measuring stereotypical bias in pretrained language models},
author = {Moin Nadeem and Anna Bethke and Siva Reddy},
journal= {arXiv preprint arXiv:2004.09456},
year = {2020}
}
备注
9 pages, 6 tables, and 3 figures