中文

神经自然语言处理中的性别偏见

计算与语言 2019-06-03 v2

摘要

我们考察神经自然语言处理(NLP)系统是否反映了训练数据中的历史偏见。我们定义了一个通用基准,以量化多种神经NLP任务中的性别偏见。我们使用在基准数据集上训练的最先进神经指代消解模型和基于RNN的教科书语言模型进行实证评估,发现模型在看待职业时存在显著的性别偏见。随后,我们通过CDA缓解偏见:一种通过因果干预进行语料增强的通用方法,可打破有性别词与中性词之间的关联。我们实证表明,CDA在保持准确率的同时有效降低了性别偏见。我们还探索了CDA、先前的词嵌入去偏方法(WED)及其组合的缓解策略空间。我们表明CDA优于WED,在词嵌入被训练时尤为显著。对于预训练嵌入,两种方法可有效组合。我们还发现,随着在原始数据集上以梯度下降进行训练,性别偏见随损失降低而增长,表明优化过程助长了偏见;CDA缓解了此行为。

关键词

引用

@article{arxiv.1807.11714,
  title  = {Gender Bias in Neural Natural Language Processing},
  author = {Kaiji Lu and Piotr Mardziel and Fangjing Wu and Preetam Amancharla and Anupam Datta},
  journal= {arXiv preprint arXiv:1807.11714},
  year   = {2019}
}