通过反事实角色反转缓解蒸馏语言模型中的性别偏见
计算与语言
2022-03-24 v1 机器学习
摘要
语言模型擅长生成连贯文本,而知识蒸馏等模型压缩技术使其能在资源受限场景下使用。然而,这些模型可能以多种方式存在偏见,包括将男女性别与性别中立职业进行无根据的关联。因此,无任何公平性约束的知识蒸馏可能会将教师模型的偏见保留或放大到蒸馏模型中。为此,我们提出一种新方法,通过在知识蒸馏过程中学习公平模型来缓解文本生成中的性别差异。我们基于反事实角色反转——修改教师概率与扩充训练集——对基础知识蒸馏提出两处改进。我们在生成的开放文本中跨职业评估了所得蒸馏及微调 GPT-2 模型的性别极性,并展示性别差异的大幅降低仅伴随效用的微小折损。最后,我们观察到在语言生成中降低性别极性的语言模型并未改善嵌入公平性或下游分类公平性。
引用
@article{arxiv.2203.12574,
title = {Mitigating Gender Bias in Distilled Language Models via Counterfactual Role Reversal},
author = {Umang Gupta and Jwala Dhamala and Varun Kumar and Apurv Verma and Yada Pruksachatkun and Satyapriya Krishna and Rahul Gupta and Kai-Wei Chang and Greg Ver Steeg and Aram Galstyan},
journal= {arXiv preprint arXiv:2203.12574},
year = {2022}
}
备注
To appear in the Findings of ACL 2022