中文

为自然语言处理生成性别增强数据

计算与语言 2021-07-14 v1

摘要

性别偏见是基于 NLP 的应用中频繁出现的现象,在具有性别屈折的语言中尤为明显。偏见可能通过某些形容词和有生名词与指称对象的自然性别的关联而出现,也可能由于屈折词在语法性别频率上的不平衡而产生。这类偏见在生成对话语句时更为明显,因为句中未指定性别,而当前大多数 NLP 应用仍基于句子级上下文工作。作为迈向更具包容性的 NLP 的一步,本文提出一种针对短对话句子的自动且可泛化的重写方法。该重写方法可应用于那些在缺乏句外上下文时具有多个性别等价替代表达的句子。该方法既可用于生成性别平衡的输出,也可用于创建性别平衡的训练数据。所提方法基于一个训练用于将一种性别替代表达“翻译”为另一种的神经机器翻译(NMT)系统。对该方法的自动与人工分析均显示出在西班牙语对话句子性别替代表达自动生成方面的 promising 结果。

关键词

引用

@article{arxiv.2107.05987,
  title  = {Generating Gender Augmented Data for NLP},
  author = {Nishtha Jain and Maja Popovic and Declan Groves and Eva Vanmassenhove},
  journal= {arXiv preprint arXiv:2107.05987},
  year   = {2021}
}

备注

10 pages, 4 tables