基于面向情感的推文分类器研究姓名中的国籍偏见与困惑度
计算与语言
2024-11-26 v2
摘要
本文提出一种方法,用于量化由不同国家的专有名实体相关联的偏见。我们在目标域数据上进行小幅扰动,创建反事实样本,而不是依赖模板或特定数据集进行偏差检测。在情感、情绪、仇恨言论和冒犯文本的常用分类器上进行分析,我们的结果显示,与所语言在国家相关的偏见在所有研究的分类器中均呈现积极趋势。值得注意的是,句子中包含 certain 国家名称可能对预测产生显著影响,仇恨言论检测的偏差可达 23%,对负面情绪如愤怒的预测偏差可达 60%。我们推测,这些偏见源于预训练语言模型 (PLM) 的训练数据,并发现情感预测与 PLMs 在英语以及如巴斯克语和毛利语等未知语言中的概率之间存在相关性,揭示了不同模式的关系,尤其是加剧了这些相关性。进一步,我们在同一句子的反事实样本之间追踪这些相关性,以消除语法成分,发现有趣的结果表明,针对英语国家名称的预训练数据影响更为重要。我们的匿名代码 [https://anonymous.4open.science/r/biases_ppl-576B/README.md](可在此处获取)。
引用
@article{arxiv.2407.01834,
title = {A Study of Nationality Bias in Names and Perplexity using Off-the-Shelf Affect-related Tweet Classifiers},
author = {Valentin Barriere and Sebastian Cifuentes},
journal= {arXiv preprint arXiv:2407.01834},
year = {2024}
}
备注
updated EMNLP camera ready version