FairFil:面向预训练文本编码器的对比式神经去偏方法
计算与语言
2021-03-12 v1 机器学习
摘要
诸如 BERT 之类的预训练文本编码器已日益应用于各类自然语言处理(NLP)任务,并近期展现出显著的性能提升。然而,近期研究揭示了这些预训练 NLP 模型中存在社会偏见。尽管已有工作在词级去偏上取得进展,预训练编码器在句子级公平性的改进仍缺乏探索。本文中,我们提出了首个面向预训练句子编码器的神经去偏方法,其通过公平滤波器(FairFil)网络将预训练编码器输出转换为去偏表示。为学习 FairFil,我们引入了一种对比学习框架,不仅最小化过滤后嵌入与偏见词之间的相关性,还保留原句子的丰富语义信息。在真实数据集上,我们的 FairFil 有效降低了预训练文本编码器的偏见程度,同时在下游任务上持续展现出理想性能。此外,我们的后验方法无需对文本编码器进行任何重训练,进一步扩大了 FairFil 的应用空间。
引用
@article{arxiv.2103.06413,
title = {FairFil: Contrastive Neural Debiasing Method for Pretrained Text Encoders},
author = {Pengyu Cheng and Weituo Hao and Siyang Yuan and Shijing Si and Lawrence Carin},
journal= {arXiv preprint arXiv:2103.06413},
year = {2021}
}
备注
Accepted by the 9th International Conference on Learning Representations (ICLR 2021)