GenderBench:衡量大语言模型中性别偏见的评估套件
计算与语言
2025-05-20 v1
摘要
我们提出 GenderBench——一个用于衡量大语言模型中性别偏见的全面评估套件。GenderBench 包含 14 个探针,用于量化大语言模型表现出的 19 种与性别相关的有害行为。我们以开源且可扩展的方式发布 GenderBench,以提高该领域基准测试的可重复性和鲁棒性。我们还对 12 个大语言模型进行了评估。我们的测量结果揭示了其行为中一致的模式。我们表明,大语言模型在处理刻板印象推理、在生成文本中实现公平的性别代表以及在高风险情境(如招聘)中偶尔处理歧视性行为方面存在挑战。
引用
@article{arxiv.2505.12054,
title = {GenderBench: Evaluation Suite for Gender Biases in LLMs},
author = {Matúš Pikuliak},
journal= {arXiv preprint arXiv:2505.12054},
year = {2025}
}