预训练印度语系语言模型的高效性别去偏
计算与语言
2022-09-09 v1
摘要
语言模型预训练数据中所存在的性别偏见会反映在使用这些模型的系统中。模型内在的性别偏见呈现出我们文化中过时且不平等的女性观,并助长歧视。因此,为建立更公平的系统并提升公正性,识别并缓解这些模型中存在的偏见至关重要。尽管英语中该领域已有大量工作,但在其他有性别区分且资源匮乏的语言(尤其是印度语言)中研究甚少。英语是无性别语言,其名词无性别之分。英语中的偏见检测方法无法直接部署到句法和语义各异的其他有性别语言上。在本文中,我们度量了印地语语言模型中与职业相关的性别偏见。我们的主要贡献在于构建了一个新颖的语料库以评估印地语中的职业性别偏见,使用明确定义的度量量化这些系统中存在的偏见,并通过高效微调模型来缓解它。我们的结果表明,引入所提缓解技术后偏见有所降低。我们的代码库已公开可用。
引用
@article{arxiv.2209.03661,
title = {Efficient Gender Debiasing of Pre-trained Indic Language Models},
author = {Neeraja Kirtane and V Manushree and Aditya Kane},
journal= {arXiv preprint arXiv:2209.03661},
year = {2022}
}