面向预训练词嵌入的保性别去偏方法
计算与语言
2019-06-04 v1 机器学习
摘要
从大规模文本集合中学习到的词嵌入已表现出显著的歧视性偏差,如性别、种族或民族偏差,这些偏差进而使使用那些词嵌入的下游NLP应用产生偏倚。以性别偏差为工作示例,我们提出一种去偏方法,在保留非歧视性性别相关信息的同时,从预训练词嵌入中移除刻板印象的歧视性性别偏差。具体而言,我们考虑四类信息:女性词、男性词、性别中立词和刻板词,它们表示性别与偏差之间的关系,并提出一种去偏方法,其(a)保留女性词和男性词中的性别相关信息,(b)保留性别中立词中的中立性,(c)从刻板词中移除偏差。在多个先前提出的基准数据集上的实验结果表明,我们提出的方法在保留性别相关但非歧视性信息的同时,比现有的用于词嵌入去偏的SOTA方法能更好地去偏预训练词嵌入。
引用
@article{arxiv.1906.00742,
title = {Gender-preserving Debiasing for Pre-trained Word Embeddings},
author = {Masahiro Kaneko and Danushka Bollegala},
journal= {arXiv preprint arXiv:1906.00742},
year = {2019}
}
备注
Accepted as a long paper to the 57th Annual Conference of the Association for Computational Linguistics (ACL-2019)