中文

IndiBias:用于衡量印度语境下语言模型社会偏见的基准数据集

计算与语言 2024-04-04 v2

摘要

社会偏见在语言数据中的普遍影响促使需要基准数据集来捕获和评估大型语言模型(LLM)中的这些偏见。现有工作主要集中在英语和西方语境,缺乏能够体现印度独特社会文化细微差别的可靠数据集。为了填补这一空白,我们引入了IndiBias,一个专门为评估印度语境下社会偏见而设计的综合基准数据集。我们筛选并翻译现有的CrowS-Pairs数据集,创建了一个适合印度语境的印地语基准数据集。此外,我们利用包括ChatGPT和InstructGPT在内的大型语言模型,用印度普遍存在的各种社会偏见和刻板印象来增强我们的数据集。包含的偏见维度包括性别、宗教、种姓、年龄、地区、外貌和职业。我们还构建了一个资源来处理三个交叉维度上的交叉偏见。我们的数据集包含800个句子对和300个元组,用于测量不同人口统计群体的偏见。数据集提供英语和印地语版本,规模与现有基准数据集相当。此外,使用IndiBias,我们在多个偏见测量指标上比较了十种不同的语言模型。我们观察到,语言模型在大多数交叉群体中表现出更多的偏见。

关键词

引用

@article{arxiv.2403.20147,
  title  = {IndiBias: A Benchmark Dataset to Measure Social Biases in Language Models for Indian Context},
  author = {Nihar Ranjan Sahoo and Pranamya Prashant Kulkarni and Narjis Asad and Arif Ahmad and Tanu Goyal and Aparna Garimella and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2403.20147},
  year   = {2024}
}