掩码语言模型及下游情感分类任务中对 93 个受污名化群体的偏见
计算机与社会
2023-06-12 v1 人工智能
计算与语言
机器学习
摘要
人工智能(AI)模型的快速部署要求对这些模型中固有的偏见与风险进行彻底调查,以理解其对个人与社会的影响。本研究通过大规模考察针对社会污名的偏见,扩展了已有工作中偏见评估的关注点。它聚焦于美国 93 个受污名化群体,涵盖与疾病、残疾、药物使用、精神疾病、宗教、性取向、社会经济地位及其他相关因素有关的广泛状况。我们考察了英语预训练掩码语言模型(MLMs)及其下游情感分类任务中针对这些群体的偏见。为评估针对 93 个受污名化状况的偏见存在与否,我们识别出 29 个非污名化状况以开展对比分析。基于社会排斥的心理学量表——社会距离量表(Social Distance Scale),我们对六种 MLM 进行提示:RoBERTa-base、RoBERTa-large、XLNet-large、BERTweet-base、BERTweet-large 与 DistilBERT。我们利用人工标注来分析这些模型预测出的词,并据此衡量针对受污名化群体的偏见程度。当提示包含受污名化状况时,MLM 预测负面词的概率比提示包含非污名化状况时约高出 20%。在情感分类任务中,当句子包含与疾病、残疾、教育和精神疾病相关的受污名化状况时,它们更可能被分类为负面。我们还观察到 MLM 中的偏见与其下游情感分类器之间存在强相关性(r=0.79)。证据表明,MLM 及其下游情感分类任务表现出针对社会受污名化群体的偏见。
引用
@article{arxiv.2306.05550,
title = {Bias Against 93 Stigmatized Groups in Masked Language Models and Downstream Sentiment Classification Tasks},
author = {Katelyn X. Mei and Sonia Fereidooni and Aylin Caliskan},
journal= {arXiv preprint arXiv:2306.05550},
year = {2023}
}
备注
20 pages,12 figures,2 tables; ACM FAccT 2023