中文

探究 BERT 中的性别偏见

计算与语言 2020-09-11 v1

摘要

上下文语言模型(CLM)已将 NLP 基准推至新的高度。在文本分类等下游任务中利用 CLM 提供的词嵌入已成为一种新规范。然而,除非加以处理,CLM 容易学习数据集中内在的性别偏见。结果,下游 NLP 模型的预测可能随性别词的变动(如将“he”替换为“she”,甚至是性别中性词)而显著变化。在本文中,我们将分析聚焦于一个流行的 CLM,即 BERT。我们分析了它在与情绪和情感强度预测相关的五个下游任务中所诱导的性别偏见。对于每个任务,我们训练一个利用 BERT 词嵌入的简单回归器。随后我们使用公平性评估语料库(equity evaluation corpus)评估回归器中的性别偏见。理想情况下且依具体设计,模型应从输入中丢弃性别信息特征。然而,结果显示系统预测对性别特定词和短语有显著依赖。我们主张此类偏见可通过从词嵌入中移除性别特定特征来削弱。因此,对于 BERT 的每一层,我们识别出主要编码性别信息的方向。由这些方向构成的空间在词嵌入语义空间中被称为性别子空间(gender subspace)。我们提出一种算法,可发现细粒度性别方向,即每个 BERT 层一个主方向。这免去了在多维中实化性别子空间的需要,并防止其他关键信息被遗漏。实验表明,移除这些方向上的嵌入分量在降低下游任务中 BERT 诱导的偏见方面取得了极大成功。

关键词

引用

@article{arxiv.2009.05021,
  title  = {Investigating Gender Bias in BERT},
  author = {Rishabh Bhardwaj and Navonil Majumder and Soujanya Poria},
  journal= {arXiv preprint arXiv:2009.05021},
  year   = {2020}
}