中文

GenderBench:衡量大语言模型中性别偏见的评估套件

计算与语言 2025-05-20 v1

摘要

我们提出 GenderBench——一个用于衡量大语言模型中性别偏见的全面评估套件。GenderBench 包含 14 个探针,用于量化大语言模型表现出的 19 种与性别相关的有害行为。我们以开源且可扩展的方式发布 GenderBench,以提高该领域基准测试的可重复性和鲁棒性。我们还对 12 个大语言模型进行了评估。我们的测量结果揭示了其行为中一致的模式。我们表明,大语言模型在处理刻板印象推理、在生成文本中实现公平的性别代表以及在高风险情境(如招聘)中偶尔处理歧视性行为方面存在挑战。

关键词

引用

@article{arxiv.2505.12054,
  title  = {GenderBench: Evaluation Suite for Gender Biases in LLMs},
  author = {Matúš Pikuliak},
  journal= {arXiv preprint arXiv:2505.12054},
  year   = {2025}
}