中文

流行问答基准中的社会偏见

计算与语言 2026-01-08 v3 人工智能 计算机与社会

摘要

问答(QA)和阅读理解(RC)基准常用于评估大型语言模型(LLM)检索和复现知识的能力。然而,我们展示了主流 QA 和 RC 基准在不同人口统计学或地理位置的问题覆盖上并不具代表性。我们对30篇基准论文和20个相应基准数据集进行内容分析和量化分析,以了解:(1) 谁参与基准创建;(2) 基准是否 exhibits 社会偏见,或是否加以解决或防止;(3) 创建者和标注者的人口统计学是否对应特定偏见。大多数基准论文未充分披露涉及基准创建的人员信息,尤其是标注者。值得注意的是,仅有 WinoGrande 明确报告了针对社会代表性问题所采取的措施。此外,数据分析揭示了跨越广泛的百科全书、常识和学术基准中存在性别、宗教和地理偏见。我们的工作添加到了对AI评估实践日益增长的批评中,并照亮了偏见基准可能是诱导 LLM 偏见的潜在来源。

关键词

引用

@article{arxiv.2505.15553,
  title  = {Social Bias in Popular Question-Answering Benchmarks},
  author = {Angelie Kraft and Judith Simon and Sonja Schimmler},
  journal= {arXiv preprint arXiv:2505.15553},
  year   = {2026}
}

备注

Presented at the main track of the IJCNLP-AACL 2025 conference (Mumbai and Online)