中文

Counter-GAP:通过性别歧义代词的反事实偏见评估

计算与语言 2023-02-14 v1 人工智能

摘要

偏见度量数据集在检测语言模型的偏倚行为以及评估偏见缓解方法的进展中起着关键作用。在本工作中,我们聚焦于通过共指消解评估性别偏见,此前的数据集或是手工构建,或无法可靠度量明确定义的偏见。为克服这些缺陷,我们提出一种通过反事实生成收集多样、自然且最小距离文本对的新方法,并构建 Counter-GAP,一个由 4008 个实例组成、归为 1002 个四元组的标注数据集。我们进一步在 Counter-GAP 上识别出先前组级度量中的偏见抵消问题,并提议使用跨性别间与性别内不一致性之差在四元组级别度量偏见。我们的结果表明,四个预训练语言模型在不同性别组间的不一致性显著大于各组内部,且基于名字的反事实数据增强方法比基于匿名化的方法更能有效缓解此类偏见。

关键词

引用

@article{arxiv.2302.05674,
  title  = {Counter-GAP: Counterfactual Bias Evaluation through Gendered Ambiguous Pronouns},
  author = {Zhongbin Xie and Vid Kocijan and Thomas Lukasiewicz and Oana-Maria Camburu},
  journal= {arXiv preprint arXiv:2302.05674},
  year   = {2023}
}

备注

Long Paper at EACL 2023