中文

语言模型的性别改头换面:以少样本数据干预缓解性别偏见

计算与语言 2023-06-08 v1 机器学习

摘要

预训练大语言模型中存在的社交偏见是一个关键问题,因为这些模型已被证明在无数下游应用中传播偏见,使它们对特定人群不公平。由于从头大规模重新训练这些模型既耗时又耗计算,先前已提出多种方法来对预训练模型去偏。虽然当前大多数最先进的去偏方法侧重于改变训练机制,但在本文中,我们提出数据干预策略作为一种强大而简单的技术,以减少预训练模型中的性别偏见。具体而言,我们通过经验表明,仅在 10 个去偏(干预)训练样本上微调预训练模型,其偏向任一性别的倾向便显著减弱。由于我们提出的方法仅需少量训练样本,我们的少样本去偏方法高度可行且实用。通过大量实验,我们表明我们的去偏技术在语言建模能力极小损失的情况下优于有竞争力的最先进基线。

关键词

引用

@article{arxiv.2306.04597,
  title  = {Language Models Get a Gender Makeover: Mitigating Gender Bias with Few-Shot Data Interventions},
  author = {Himanshu Thakur and Atishay Jain and Praneetha Vaddamanu and Paul Pu Liang and Louis-Philippe Morency},
  journal= {arXiv preprint arXiv:2306.04597},
  year   = {2023}
}

备注

Accepted to ACL 2023 Main Conference