MABEL:利用文本蕴含数据减弱性别偏见
计算与语言
2022-10-28 v1 机器学习
摘要
预训练语言模型编码了不良的社会偏见,这些偏见在下游使用中会进一步加剧。为此,我们提出了 MABEL(一种利用蕴含标签减弱性别偏见的方法),这是一种用于减轻上下文表示中性别偏见的中间预训练方法。我们方法的关键在于,在来自自然语言推理(NLI)数据集的反事实增强、性别平衡的蕴含对上进行对比学习目标。我们还引入了一个对齐正则化器,它将沿相反性别方向的相同蕴含对拉得更近。我们在内在和外在指标上广泛评估了我们的方法,并表明 MABEL 在公平性方面优于以往的任务无关去偏方法。它还在下游任务的微调后保持了任务性能。总之,这些发现证明了 NLI 数据作为偏见缓解有效手段的适用性,这与文献中仅使用无标签句子的做法形成对比。最后,我们指出现有方法经常使用不充分或不一致的评估设置。我们努力复现并比较了先前的方法,并呼吁统一性别去偏方法的评估设置,以便未来进行更好的比较。
引用
@article{arxiv.2210.14975,
title = {MABEL: Attenuating Gender Bias using Textual Entailment Data},
author = {Jacqueline He and Mengzhou Xia and Christiane Fellbaum and Danqi Chen},
journal= {arXiv preprint arXiv:2210.14975},
year = {2022}
}
备注
Accepted to EMNLP 2022. Code and models are publicly available at https://github.com/princeton-nlp/mabel