中文

PBBQ:面向大语言模型的波斯语偏见基准数据集

计算与语言 2025-10-23 v1

摘要

随着大语言模型(LLM)的广泛采用,确保其与社会规范的一致性已成为 critical concern。虽然先前研究在 various languages 中考察了偏见检测,但在针对波斯语文化语境的社会偏见资源方面仍存显著缺口。本工作引入 PBBQ,一个综合性基准数据集,用于评估波斯语 LLM 中的社会偏见。该基准涵盖 16 个文化类别,由 250 名来自不同人口统计学背景的个体完成问卷,密切合作由社会科学专家确保其有效性。最终得到的 PBBQ 数据集包含超过 37,000 条精心策划的问卷问题,为波斯语语言模型的评估与偏见缓解奠定了基础。我们在 PBBQ 上对多种开源 LLM、一个封闭源模型以及波斯语特定微调模型进行基准测试。我们的发现表明,当前 LLM 在波斯语文化中表现出显著的社会偏见。此外,通过将模型输出与人类响应进行比较,我们观察到 LLM 常常复制人类偏见模式,凸显了学习表示与文化刻板印象之间复杂的相互作用。在论文接受后,我们的 PBBQ 数据集将对未来工作开放获取。内容警告:本文包含不安全内容。

关键词

引用

@article{arxiv.2510.19616,
  title  = {PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models},
  author = {Farhan Farsi and Shayan Bali and Fatemeh Valeh and Parsa Ghofrani and Alireza Pakniat and Kian Kashfipour and Amir H. Payberah},
  journal= {arXiv preprint arXiv:2510.19616},
  year   = {2025}
}