利用潜变量解耦与反事实生成消除词嵌入中的性别偏见
计算与语言
2020-11-04 v2 机器学习
机器学习
摘要
近期研究表明,基于人工生成语料训练的词嵌入在嵌入空间中具有强烈的性别偏见,并且这些偏见会导致各种下游任务产生歧视性结果。先前的方法将词嵌入投影到线性子空间以去偏,我们则引入了一种带有孪生自编码器结构并辅以适配梯度反转层的潜变量解耦(Latent Disentanglement)方法。我们的结构能够将给定词的语义潜变量信息与性别潜变量信息分离到不相交的潜变量维度中。随后,我们引入反事实生成(Counterfactual Generation)来转换词的性别信息,从而在几何对齐正则化后,原始与修改后的嵌入可以产生性别中立的词嵌入,且不损失语义信息。从各种定量与定性去偏实验来看,我们的方法在词嵌入去偏上优于现有的去偏方法。此外,我们的方法通过最小化外在 NLP 下游任务的语义信息损失,展现出在去偏过程中保留语义信息的能力。
引用
@article{arxiv.2004.03133,
title = {Neutralizing Gender Bias in Word Embedding with Latent Disentanglement and Counterfactual Generation},
author = {Seungjae Shin and Kyungwoo Song and JoonHo Jang and Hyemi Kim and Weonyoung Joo and Il-Chul Moon},
journal= {arXiv preprint arXiv:2004.03133},
year = {2020}
}
备注
Findings of EMNLP2020