语言模型中的系统性攻击性刻板印象(SOS)偏差
计算与语言
2024-04-29 v2
摘要
在本文中,我们提出一种新度量来度量语言模型(LM)中的 SOS 偏差。随后,我们验证了 SOS 偏差并研究去除该偏差的有效性。最后,我们探究了 LM 中 SOS 偏差对其在仇恨言论检测上性能与公平性的影响。我们的结果表明,所有受检 LM 均存在 SOS 偏差。并且该 SOS 偏差反映了边缘化身份群体所经历的线上仇恨。结果表明,使用文献中的去偏方法会加剧某些敏感属性的 SOS 偏差,而改善其他属性。最后,我们的结果表明受检 LM 中的 SOS 偏差对其仇恨言论检测的公平性有影响。然而,没有强证据表明 SOS 偏差对仇恨言论检测的性能有影响。
引用
@article{arxiv.2308.10684,
title = {Systematic Offensive Stereotyping (SOS) Bias in Language Models},
author = {Fatma Elsafoury},
journal= {arXiv preprint arXiv:2308.10684},
year = {2024}
}
备注
Keywords: Systematic offensive stereotyping (SOS) bias, Language models, bias removal, fairness, hate speech detection