中文

PakBBQ:为 QA 构建文化适配性偏见基准

计算与语言 2025-09-30 v2 人工智能 计算机与社会 机器学习

摘要

随着大型语言模型(LLM)在各类应用中的广泛采用,确保其在所有用户社区中的公平性至关重要。然而,大多数 LLM 都是在以西方中心主义数据上进行训练和评估的,对于低资源语言和地区语境关注不足。为此,我们引入PakBBQ,这是一个在原始偏见基准问答数据集(BBQ)基础上进行的文化和地区适配扩展。PakBBQ 包含超过 214 个模板,覆盖 8 个类别、17180 对问答对,涵盖英语和乌尔都语,涉及八个偏见维度:年龄、残疾、外貌、性别、社会经济地位、宗教、地区归属和语言正式程度,这些在巴基斯坦语境中具有相关性。我们在模糊且明确消除歧义的语境下,对多语言 LLM 进行评估,以及积极与消极问句的表述。我们的实验发现:(i)消除歧义后准确率提升约 12%;(ii)乌尔都语中对偏见的抵抗行为始终优于英语;(iii)明显的框架效应会降低在消极问句下的偏见性回答。这些发现凸显了在低资源环境中进行偏见缓解的上下文化基准和简单提示工程策略的重要性。

关键词

引用

@article{arxiv.2508.10186,
  title  = {PakBBQ: A Culturally Adapted Bias Benchmark for QA},
  author = {Abdullah Hashmat and Muhammad Arham Mirza and Agha Ali Raza},
  journal= {arXiv preprint arXiv:2508.10186},
  year   = {2025}
}

备注

13 total pages, 7 figures, 2 tables, Accepted at Main Conference of EMNLP 2025