反事实增强数据与无意偏差:以性别歧视与仇恨言论检测为例
计算与语言
2022-05-10 v1
摘要
反事实增强数据(Counterfactually Augmented Data, CAD)旨在提升分布外泛化能力,这是模型鲁棒性的一个指标。该改进归功于促进构念的核心特征而非与之偶然相关的虚假伪迹。然而,过度依赖核心特征可能导致无意的模型偏差。特别是,构念驱动的 CAD——对核心特征的扰动——可能诱导模型忽略核心特征被使用的语境。在此,我们在具有挑战性的数据上测试性别歧视与仇恨言论检测模型:身份词与性别词的非仇恨、非性别歧视用法。在这些困难案例中,在 CAD 上训练的模型,尤其是构念驱动的 CAD,比在原始未扰动数据上训练的模型表现出更高的假阳性率。使用多样化的 CAD 集合——构念驱动与构念无关的——可降低此类无意偏差。
引用
@article{arxiv.2205.04238,
title = {Counterfactually Augmented Data and Unintended Bias: The Case of Sexism and Hate Speech Detection},
author = {Indira Sen and Mattia Samory and Claudia Wagner and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2205.04238},
year = {2022}
}
备注
Accepted to NAACL'22 as a short paper