双重硬去偏:为缓解性别偏见定制词嵌入
计算与语言
2020-05-05 v1 机器学习
摘要
从人类生成的语料库中导出的词嵌入继承了强烈的性别偏见,并可能被下游模型进一步放大。一些常用的去偏方法,包括开创性的Hard Debias算法,采用后处理流程将预训练词嵌入投影到与推断出的性别子空间正交的子空间中。我们发现,词嵌入所捕获的诸如词频等语义无关语料规律会对这些算法的性能产生负面影响。我们提出了一种简单但有效的技术,Double Hard Debias(双重硬去偏),它在推断并移除性别子空间之前,先针对此类语料规律对词嵌入进行净化。在三个去偏基准上的实验表明,我们的方法在保留预训练词嵌入分布语义的同时,比先前方法更大程度地降低了性别偏见。
引用
@article{arxiv.2005.00965,
title = {Double-Hard Debias: Tailoring Word Embeddings for Gender Bias Mitigation},
author = {Tianlu Wang and Xi Victoria Lin and Nazneen Fatema Rajani and Bryan McCann and Vicente Ordonez and Caiming Xiong},
journal= {arXiv preprint arXiv:2005.00965},
year = {2020}
}
备注
Accepted to ACL 2020