中文

面向预训练词嵌入的保性别去偏方法

计算与语言 2019-06-04 v1 机器学习

摘要

从大规模文本集合中学习到的词嵌入已表现出显著的歧视性偏差,如性别、种族或民族偏差,这些偏差进而使使用那些词嵌入的下游NLP应用产生偏倚。以性别偏差为工作示例,我们提出一种去偏方法,在保留非歧视性性别相关信息的同时,从预训练词嵌入中移除刻板印象的歧视性性别偏差。具体而言,我们考虑四类信息:女性词、男性词、性别中立词和刻板词,它们表示性别与偏差之间的关系,并提出一种去偏方法,其(a)保留女性词和男性词中的性别相关信息,(b)保留性别中立词中的中立性,(c)从刻板词中移除偏差。在多个先前提出的基准数据集上的实验结果表明,我们提出的方法在保留性别相关但非歧视性信息的同时,比现有的用于词嵌入去偏的SOTA方法能更好地去偏预训练词嵌入。

关键词

引用

@article{arxiv.1906.00742,
  title  = {Gender-preserving Debiasing for Pre-trained Word Embeddings},
  author = {Masahiro Kaneko and Danushka Bollegala},
  journal= {arXiv preprint arXiv:1906.00742},
  year   = {2019}
}

备注

Accepted as a long paper to the 57th Annual Conference of the Association for Computational Linguistics (ACL-2019)