中文

SeeGULL Multilingual:一个地理文化语境下的刻板印象数据集

计算与语言 2024-03-12 v1 计算机视觉与模式识别

摘要

尽管生成式多语言模型正在被快速部署,但其安全性与公平性评估很大程度上局限于以英语收集的资源。这对于评估本质上涉及社会文化现象(如刻板印象)而言尤为成问题,因为构建反映各语言社区普遍刻板印象的多语言资源至关重要。然而,在不同语言和地区大规模收集这些资源构成了重大挑战,因为这需要广泛的社会文化知识,且成本可能极其高昂。为了弥补这一关键空白,我们采用了一种最近引入的方法,将 LLM 生成的大规模性与基于文化语境的验证的可靠性相结合,构建了 SeeGULL Multilingual,这是一个全球规模的多语言社会刻板印象数据集,包含超过 25K 条刻板印象,涵盖 20 种语言,并拥有跨 23 个地区的人工标注,我们展示了其在识别模型评估空白方面的效用。内容警告:本文中分享的刻板印象可能具有冒犯性。

关键词

引用

@article{arxiv.2403.05696,
  title  = {SeeGULL Multilingual: a Dataset of Geo-Culturally Situated Stereotypes},
  author = {Mukul Bhutani and Kevin Robinson and Vinodkumar Prabhakaran and Shachi Dave and Sunipa Dev},
  journal= {arXiv preprint arXiv:2403.05696},
  year   = {2024}
}