中文

利用性别均衡损失函数降低词级语言模型中的性别偏见

计算与语言 2019-06-05 v2

摘要

自然语言数据集中存在性别偏见,神经语言模型往往会学习这些偏见,从而导致有偏见的文本生成。在本研究中,我们提出了一种基于损失函数修改的去偏方法。我们在损失函数中引入了一项新项,试图均衡输出中男性与女性词的概率。利用一系列偏见评估指标,我们提供了经验证据,表明我们的方法在不增加困惑度的前提下成功缓解了语言模型中的性别偏见。与现有的去偏策略、数据增强以及词嵌入去偏相比,我们的方法在多个方面表现更优,尤其是在降低职业词汇中的性别偏见方面。最后,我们引入了数据增强与我们的方法相结合的方式,并表明其在所有偏见评估指标上均优于现有策略。

关键词

引用

@article{arxiv.1905.12801,
  title  = {Reducing Gender Bias in Word-Level Language Models with a Gender-Equalizing Loss Function},
  author = {Yusu Qian and Urwa Muaz and Ben Zhang and Jae Won Hyun},
  journal= {arXiv preprint arXiv:1905.12801},
  year   = {2019}
}

备注

Accepted at ACL-SRW 2019. To appear in Proceedings of ACL-SRW 2019