德语性别偏差问答基准:GG-BBQ
计算与语言
2025-07-23 v1 计算机与社会
机器学习
摘要
在自然语言处理 (NLP) 语境中,公平性评估常与评估偏差及其相关伤害的减少相关联。为此,通常通过针对诸如问答等任务创建的基准数据集进行评估,以衡量模型预测在 various dimensions(包括性别身份)方面的偏差。在本工作中,我们使用 Parrish 等人 (2022) 提出的问答偏差基准评估德语大型语言模型 (LLM) 中的性别偏差。具体而言,将该英文数据集中性别身份子集的模板机翻为德语。随后,对机器翻译模板中的错误进行手动审查和纠正,并借助语言专家的帮助。我们发现,由于从英语翻译至具有语法性别的德语的机器翻译存在局限性,因此对翻译进行手动修订对于创建性别偏差评估数据集至关重要。我们的最终数据集包含两个子集:子集 I 包含与性别身份相关的群体术语,子集 II 将群体术语替换为专有名词。我们对几个用于德语 NLP 的 LLM 在新建数据集上的表现进行评估,并报告准确率和偏差分数。结果显示,所有模型都表现出偏差,既沿用现有的社会偏见,也偏离现有的社会偏见。
引用
@article{arxiv.2507.16410,
title = {GG-BBQ: German Gender Bias Benchmark for Question Answering},
author = {Shalaka Satheesh and Katrin Klug and Katharina Beckh and Héctor Allende-Cid and Sebastian Houben and Teena Hassan},
journal= {arXiv preprint arXiv:2507.16410},
year = {2025}
}
备注
Accepted to the 6th Workshop on Gender Bias in Natural Language Processing (GeBNLP), taking place on August 1st 2025, as part of ACL 2025 in Vienna