缓解预训练语言模型中性别偏见的投影方法
计算与语言
2024-05-27 v1
摘要
NLP 中性别偏见的缓解有着与静态词嵌入去偏紧密相关的悠久历史。最近,人们的注意力已转向预训练语言模型的去偏。我们研究了为词嵌入开发的最简单的投影去偏方法在应用于 BERT 的内部表示时能在多大程度上提供帮助。投影方法实现速度快,使用少量已保存参数,且不对现有模型参数进行任何更新。我们评估了这些方法在减少内在偏见(通过 BERT 的下一句预测任务测量)以及在微调时缓解下游环境中观察到的偏见方面的有效性。为此,我们还对一种用于量化内在偏见的流行性别偏见评估测试进行了批判性分析,从而得到了一个增强的测试集和新的偏见度量。我们发现,投影方法在内在偏见和下游偏见缓解方面均能有效,但这两种结果不一定相关。这一发现作为一种警示:基于语言建模任务或下一句预测的内在偏见测试集,不应成为开发去偏语言模型的唯一基准。
引用
@article{arxiv.2403.18803,
title = {Projective Methods for Mitigating Gender Bias in Pre-trained Language Models},
author = {Hillary Dawkins and Isar Nejadgholi and Daniel Gillis and Judi McCuaig},
journal= {arXiv preprint arXiv:2403.18803},
year = {2024}
}