中文

性别偏见及其藏身之处:利用运动剪枝探索基于Transformer的预训练语言模型中的性别偏见

计算与语言 2022-07-07 v1

摘要

语言模型去偏已在NLP社区中成为一个重要研究领域。人们提出了众多去偏技术,但偏见消融仍是一个未解决的问题。我们展示了一个通过运动剪枝检查基于transformer的预训练语言模型中偏见的新型框架。给定一个模型和一个去偏目标,我们的框架能找到模型的一个子集,其包含的偏见少于原始模型。我们通过在该去偏目标上微调模型的同时对模型进行剪枝来实现我们的框架。仅对剪枝分数进行优化——这些分数与模型权重耦合并充当门控的参数。我们以剪枝注意力头(transformer的重要构建模块)进行实验:我们剪枝方形块,并建立了一种剪枝整个头的新方法。最后,我们使用性别偏见演示了我们框架的用法,并基于我们的发现对一种现有去偏方法提出了改进。此外,我们重新发现了一种偏见-性能权衡:模型表现越好,其包含的偏见越多。

关键词

引用

@article{arxiv.2207.02463,
  title  = {Gender Biases and Where to Find Them: Exploring Gender Bias in Pre-Trained Transformer-based Language Models Using Movement Pruning},
  author = {Przemyslaw Joniak and Akiko Aizawa},
  journal= {arXiv preprint arXiv:2207.02463},
  year   = {2022}
}

备注

Accepted to NAACL2022, 4th Workshop on Gender Bias in Natural Language Processing