中文

识别并适配英语语言模型中导致性别偏见的Transformer组件

计算与语言 2023-10-20 v1 人工智能

摘要

语言模型(LMs)展现并放大了从训练数据中习得的多种不良偏见,包括性别偏见。然而,我们缺乏在不损害通用语言建模性能的前提下有效且高效地改变此行为的工具。本文中,我们研究了三种识别LM组件与特定输出之间因果关系的方法:因果中介分析、自动电路发现以及我们提出的基于差分掩码、名为DiffMask+的高效新方法。我们将这些方法应用于GPT-2 small和性别偏见问题,并利用发现的组件集合进行参数高效微调以缓解偏见。我们的结果显示所识别的组件有显著重叠(尽管各方法在计算需求上差异巨大),并且在缓解性别偏见方面取得成功,与全模型微调相比对通用语言建模的损害更小。然而,我们的工作也强调了定义和度量偏见的困难,以及因果发现过程对数据集选择的敏感性。我们希望我们的工作能促使更多关注数据集构建,并带来针对其他类型偏见更有效的缓解策略。

关键词

引用

@article{arxiv.2310.12611,
  title  = {Identifying and Adapting Transformer-Components Responsible for Gender Bias in an English Language Model},
  author = {Abhijith Chintam and Rahel Beloch and Willem Zuidema and Michael Hanna and Oskar van der Wal},
  journal= {arXiv preprint arXiv:2310.12611},
  year   = {2023}
}

备注

Accepted at BlackboxNLP 2023