中文

利用有偏模型去偏文本:一种性别公平改写模型

计算与语言 2023-05-19 v1

摘要

自然语言生成模型再现并经常放大其训练数据中存在的偏见。先前的研究探索使用序列到序列改写模型,通过语言规则创建伪训练数据,将偏见的模型输出(或原始文本)转换为更性别公平的语言。然而,这种方法对于形态比英语更复杂的语言并不实用。我们假设以相反方向创建训练数据,即从性别公平文本出发,对于形态复杂语言更容易,并表明其在英语上匹配了最先进改写模型的性能。为了消除数据创建的基于规则的性质,我们转而提出使用机器翻译模型通过往返翻译从真实性别公平文本创建性别偏见文本。我们的方法使我们能够训练德语改写模型而无需精心手工制作规则。如人工评估研究所示,该模型的输出增加了性别公平性。

关键词

引用

@article{arxiv.2305.11140,
  title  = {Exploiting Biased Models to De-bias Text: A Gender-Fair Rewriting Model},
  author = {Chantal Amrhein and Florian Schottmann and Rico Sennrich and Samuel Läubli},
  journal= {arXiv preprint arXiv:2305.11140},
  year   = {2023}
}

备注

accepted to ACL 2023