中文

通过考虑全部标签评估预训练语言模型在自然语言推理中的性别偏见

计算与语言 2024-05-21 v3

摘要

已在多种语言的预训练语言模型(PLMs)中发现歧视性性别偏见。在自然语言推理(NLI)中,现有偏见评估方法聚焦于三个标签中某一个特定标签(如中性)的预测结果。然而,此类评估方法可能不准确,因为独特的偏见推断与独特的预测标签相关联。针对此局限,我们提出一种称为 NLI-CoAL 的 PLM 偏见评估方法,其考虑 NLI 任务的全部三个标签。首先,我们创建代表不同类型偏见的三个评估数据组。然后,我们基于每组数据的对应标签输出定义偏见度量。在实验中,我们引入一种针对 NLI 偏见度量的元评估技术,并用它确认我们的偏见度量比基线更能区分有偏见的错误推断与无偏见的错误推断,从而实现更准确的偏见评估。我们构建了英语、日语和汉语的数据集,并成功验证了我们的偏见度量在多种语言间的兼容性。最后,我们观察到不同语言 PLM 中的偏见倾向。据我们所知,我们首次构建了评估数据集并从 NLI 角度度量日语和汉语 PLM 的偏见。

关键词

引用

@article{arxiv.2309.09697,
  title  = {Evaluating Gender Bias of Pre-trained Language Models in Natural Language Inference by Considering All Labels},
  author = {Panatchakorn Anantaprayoon and Masahiro Kaneko and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2309.09697},
  year   = {2024}
}

备注

LREC-COLING 2024