中文

荷兰语 CrowS-Pairs:为衡量语言模型中社会偏见的挑战数据集适配

计算与语言 2025-07-23 v1

摘要

警告:本文包含可能令人不快的冒犯性刻板印象表述。语言模型容易表现出偏见,进一步放大不公平且有害的刻板印象。鉴于这些模型的快速普及和广泛应用,有必要确保语言模型的安全与公平。近期大量关注衡量语言模型中的偏见,但大多数研究仅聚焦于英语。本文介绍了一个荷兰语版本的美国特定 CrowS-Pairs 数据集,用于衡量荷兰语语言模型中的偏见。该数据集由 1463 对句子对组成,覆盖 9 类偏见,如性取向、性别与残疾。句子对由对比句子组成,其中一句涉及劣势群体,另一句涉及优势群体。使用荷兰语 CrowS-Pairs 数据集,我们表明各种语言模型(BERTje、RobBERT、多语言 BERT、GEITje 与 Mistral-7B)在各偏见类别中表现出显著偏见。我们使用英语和法语版本的 CrowS-Pairs 数据集评估了英语模型(BERT 与 RoBERTa)和法语模型(FlauBERT 与 CamemBERT)中的偏见,发现英语模型呈现的最偏见,而荷兰语模型则表现出最少的偏见。此外,结果还表明,为语言模型分配人格会改变其所表现出的偏见水平。这些发现凸显了偏见在不同语言和语境中的可变性,表明文化和语言因素在塑造模型偏见方面发挥着重要作用。

关键词

引用

@article{arxiv.2507.16442,
  title  = {Dutch CrowS-Pairs: Adapting a Challenge Dataset for Measuring Social Biases in Language Models for Dutch},
  author = {Elza Strazda and Gerasimos Spanakis},
  journal= {arXiv preprint arXiv:2507.16442},
  year   = {2025}
}

备注

10 pages, accepted at RANLP 2025 data and code here: https://github.com/jerryspan/Dutch-CrowS-Pairs