GeniL:一个关于语言泛化的多语言数据集
计算与语言
2024-08-12 v2
摘要
生成式语言模型正在改变我们的数字生态系统,但它们常常继承社会偏见,例如将某些属性与特定身份群体联系起来的刻板印象。虽然这些偏见是否以及如何被缓解可能取决于具体的用例,但能够有效检测刻板印象延续的实例是至关重要的第一步。当前评估生成语言中刻板印象存在的方法依赖于简单的模板或基于共现的度量,而没有考虑它们所体现的句子上下文的多样性。我们认为理解句子上下文对于检测泛化实例至关重要。我们区分了两种类型的泛化:(1) 仅仅提及泛化存在的语言(“人们认为法国人很粗鲁”),以及 (2) 强化这种泛化的语言(“作为法国人,他们一定很粗鲁”),与非泛化上下文(“我的法国朋友认为我很粗鲁”)区分开来。为了进行有意义的刻板印象评估,我们需要可靠地区分这类泛化实例。我们引入了检测语言中泛化的新任务,并构建了GeniL,一个包含来自9种语言(英语、阿拉伯语、孟加拉语、西班牙语、法语、印地语、印度尼西亚语、马来语和葡萄牙语)超过5万句子的多语言数据集,并标注了泛化实例。我们证明,共现成为泛化实例的可能性通常很低,并且在不同语言、身份群体和属性之间有所变化。我们构建了分类器来检测语言中的泛化,总体PR-AUC为58.7,在不同语言上表现各异。我们的研究提供了数据和工具,以实现对刻板印象延续的细致理解,这是迈向更具包容性和负责任的语言技术的关键一步。
引用
@article{arxiv.2404.05866,
title = {GeniL: A Multilingual Dataset on Generalizing Language},
author = {Aida Mostafazadeh Davani and Sagar Gubbi and Sunipa Dev and Shachi Dave and Vinodkumar Prabhakaran},
journal= {arXiv preprint arXiv:2404.05866},
year = {2024}
}