中文

性别去偏如何影响模型内部表示及其重要性

计算与语言 2022-05-18 v2

摘要

NLP 中性别偏见的常见研究要么关注通过模型在下游任务上的性能衡量的外在偏见,要么关注在模型内部表示中发现的内在偏见。然而,外在偏见与内在偏见之间的关系相对未知。在这项工作中,我们通过同时度量两者来阐明该关系:我们在下游微调过程中对模型去偏(这降低了外在偏见),并度量其对内在偏见的影响,后者被操作为利用信息论探测的偏见可提取性。通过在两个任务和多个偏见度量上的实验,我们表明我们的内在偏见度量比(标准 WEAT 度量的上下文适配版)更能指示去偏效果,并且还能暴露表面去偏的情况。我们的框架提供了对 NLP 模型中偏见的全面视角,可应用于以更知情的方式部署 NLP 系统。我们的代码与模型检查点已公开可用。

关键词

引用

@article{arxiv.2204.06827,
  title  = {How Gender Debiasing Affects Internal Model Representations, and Why It Matters},
  author = {Hadas Orgad and Seraphina Goldfarb-Tarrant and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2204.06827},
  year   = {2022}
}

备注

Accepted to NAACL 2022