基于偏见探测的语言模型语言无关偏见检测
计算与语言
2023-11-21 v2
摘要
预训练语言模型(PLMs)是 NLP 的关键组件,但它们包含强烈的社会偏见。量化这些偏见具有挑战性,因为当前关注填掩码目标的方法对输入的细微变化很敏感。为此,我们提出了一种称为 LABDet 的偏见探测技术,用于以鲁棒且语言无关的方法评估 PLM 中的社会偏见。以国籍作为案例研究,我们表明 LABDet 通过在冻结的 PLM 之上训练一个非国籍情感检测的分类器来“暴露”国籍偏见。我们发现了六种语言单语 PLM 中一致的国籍偏见模式,这些模式与历史和政治背景相符。我们还针对英语 BERT 表明,LABDet 暴露的偏见与预训练数据中的偏见高度相关;因此,我们的工作是少数直接将预训练数据与 PLM 行为联系起来的研究之一。最后,我们通过一组广泛的鲁棒性检查验证了 LABDet 对不同模板和语言的可靠性和适用性。我们在 https://github.com/akoksal/LABDet 公开分享我们的代码和数据集。
引用
@article{arxiv.2305.13302,
title = {Language-Agnostic Bias Detection in Language Models with Bias Probing},
author = {Abdullatif Köksal and Omer Faruk Yalcin and Ahmet Akbiyik and M. Tahir Kilavuz and Anna Korhonen and Hinrich Schütze},
journal= {arXiv preprint arXiv:2305.13302},
year = {2023}
}
备注
EMNLP 2023 Findings