GECOBench:用于量化解释中偏差的性别控制文本数据集与基准
机器学习
2026-01-22 v2 人工智能
计算与语言
计算机与社会
摘要
大型预训练语言模型已成为自然语言处理(NLP)中许多下游任务的关键骨干,虽然它们是在包含各种偏差(例如性别偏差)的大量数据上训练的,但已有研究表明它们也可能在其权重中继承此类偏差,从而可能影响其预测行为。然而,目前尚不清楚这些偏差在多大程度上也会影响通过应用“可解释人工智能”(XAI)技术生成的特征归因,可能以不利的方式。为了系统地研究这个问题,我们创建了一个性别控制的文本数据集 GECO,其中语法性别形式的改变会诱导出类别特定词,并为性别分类任务提供真实特征归因。这使得能够客观评估 XAI 方法的正确性。我们将此数据集应用于预训练的 BERT 模型,并对其进行不同程度的微调,以定量衡量预训练如何在特征归因中引入不良偏差,以及微调能在多大程度上减轻这种解释偏差。为此,我们提供了 GECOBench,一个用于基准测试流行 XAI 方法的严格定量评估框架。我们展示了解释性能与微调层数之间的明确依赖关系,观察到 XAI 方法尤其受益于嵌入层的微调或完全重新训练。
引用
@article{arxiv.2406.11547,
title = {GECOBench: A Gender-Controlled Text Dataset and Benchmark for Quantifying Biases in Explanations},
author = {Rick Wilming and Artur Dox and Hjalmar Schulz and Marta Oliveira and Benedict Clark and Stefan Haufe},
journal= {arXiv preprint arXiv:2406.11547},
year = {2026}
}
备注
Published in Frontiers