中文

在无人工标注样本情况下比较内在性别偏见评估度量

计算与语言 2023-01-31 v1

摘要

在预训练语言模型(PLMs)中已识别出众多类型的社会偏见,并提出了各种内在偏见评估度量来量化这些社会偏见。先前工作依赖人工标注样本来比较现有的内在偏见评估度量。然而,由于招募人类标注者的成本与困难,该方法不易适配不同语言,也难以进行大规模评估。为克服此限制,我们提出一种不依赖人工标注样本来比较内在性别偏见评估度量的方法。具体而言,我们使用从非标注语料库通过性别相关词表自动挖掘的、数量不等的男性与女性性别句子,创建多个偏见受控版本的 PLMs。接着,使用一种内在偏见评估度量评估每个偏见受控 PLM,并计算所算得的偏见分数与用于微调 PLMs 的性别比例之间的秩相关性。在多个语料库与 PLMs 上的实验反复表明,我们提出的无需人工标注样本的方法所报告的相关性,与先前工作使用人工标注样本计算的相关性相当。

关键词

引用

@article{arxiv.2301.12074,
  title  = {Comparing Intrinsic Gender Bias Evaluation Measures without using Human Annotated Examples},
  author = {Masahiro Kaneko and Danushka Bollegala and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2301.12074},
  year   = {2023}
}

备注

EACL 2023