语言模型的可持续模块化去偏
计算与语言
2021-09-09 v1
摘要
现代预训练语言模型(PLM)中编码的不公平刻板偏见(例如性别、种族或宗教偏见)对最先进语言技术的广泛采用具有负面伦理影响。为此,近期引入了多种去偏技术以从 PLM 中移除此类刻板偏见。然而,现有的去偏方法直接修改 PLM 的所有参数,这——除了计算昂贵之外——还带有(灾难性)遗忘预训练中有用语言知识的固有风险。在这项工作中,我们提出一种基于专用去偏适配器的更可持续模块化去偏方法,称为 ADELE。具体而言,我们(1)将适配器模块注入原始 PLM 层,并(2)通过在反事实增强语料库上进行语言建模训练仅更新适配器(即保持原始 PLM 参数冻结)。我们在 BERT 的性别去偏中展示了 ADELE:我们的广泛评估涵盖三个内在和两个外在偏见度量,表明 ADELE 在偏见缓解方面非常有效。我们进一步表明——由于其模块化特性——ADELE 与任务适配器结合,即使在大规模下游训练后仍保持公平性。最后,借助多语言 BERT,我们成功将 ADELE 迁移到六种目标语言。
引用
@article{arxiv.2109.03646,
title = {Sustainable Modular Debiasing of Language Models},
author = {Anne Lauscher and Tobias Lüken and Goran Glavaš},
journal= {arXiv preprint arXiv:2109.03646},
year = {2021}
}
备注
Accepted for EMNLP-Findings 2021