阿拉伯语平行性别语料库 2.0:扩展与分析
计算与语言
2021-10-19 v1
摘要
自然语言处理(NLP)应用中的性别偏见,尤其是机器翻译中的性别偏见,正受到越来越多的关注。关于此问题的许多研究集中在缓解英语 NLP 模型与系统中的性别偏见。在资源匮乏和/或形态丰富的语言中解决该问题则相对滞后,主要原因是缺乏数据集与资源。在本文中,我们引入了一个新语料库,用于在涉及一个或两个目标用户(我“和/或”你)的语境中进行性别识别与改写——即具有独立语法性别偏好的第一和第二语法人称。我们重点关注阿拉伯语,一种具有性别标记的形态丰富语言。该语料库包含多个平行组件:第一和第二人称在阴性与阳性语法性别下的四种组合,以及英语和英阿机器翻译输出。该语料库在 Habash 等人(2019)的阿拉伯语平行性别语料库(APGC v1.0)基础上进行了扩展,增加了第二人称目标,并将句子总数增加了 6.5 倍以上,达到超过 59 万词。我们的新数据集将助力性别识别、可控文本生成和译后编辑改写系统的研究与开发,这些系统可用于实现 NLP 应用的个性化,并根据用户的语法性别偏好向其提供正确输出。我们公开了阿拉伯语平行性别语料库(APGC v2.0)。
引用
@article{arxiv.2110.09216,
title = {The Arabic Parallel Gender Corpus 2.0: Extensions and Analyses},
author = {Bashar Alhafni and Nizar Habash and Houda Bouamor},
journal= {arXiv preprint arXiv:2110.09216},
year = {2021}
}