中文

语言模型的可持续模块化去偏

计算与语言 2021-09-09 v1

摘要

现代预训练语言模型(PLM)中编码的不公平刻板偏见(例如性别、种族或宗教偏见)对最先进语言技术的广泛采用具有负面伦理影响。为此,近期引入了多种去偏技术以从 PLM 中移除此类刻板偏见。然而,现有的去偏方法直接修改 PLM 的所有参数,这——除了计算昂贵之外——还带有(灾难性)遗忘预训练中有用语言知识的固有风险。在这项工作中,我们提出一种基于专用去偏适配器的更可持续模块化去偏方法,称为 ADELE。具体而言,我们(1)将适配器模块注入原始 PLM 层,并(2)通过在反事实增强语料库上进行语言建模训练仅更新适配器(即保持原始 PLM 参数冻结)。我们在 BERT 的性别去偏中展示了 ADELE:我们的广泛评估涵盖三个内在和两个外在偏见度量,表明 ADELE 在偏见缓解方面非常有效。我们进一步表明——由于其模块化特性——ADELE 与任务适配器结合,即使在大规模下游训练后仍保持公平性。最后,借助多语言 BERT,我们成功将 ADELE 迁移到六种目标语言。

关键词

引用

@article{arxiv.2109.03646,
  title  = {Sustainable Modular Debiasing of Language Models},
  author = {Anne Lauscher and Tobias Lüken and Goran Glavaš},
  journal= {arXiv preprint arXiv:2109.03646},
  year   = {2021}
}

备注

Accepted for EMNLP-Findings 2021