Bipol:一种可解释的多轴 NLP 偏见评估新指标
计算与语言
2023-09-19 v2
摘要
我们介绍 bipol,一种具有可解释性的新指标,用于估计文本数据中的社会偏见。有害偏见普遍存在于许多用于训练机器学习(ML)模型的在线数据源中。为应对这一挑战,我们创建了一种新颖指标,其包含两步过程:基于模型分类的语料库级评估,以及基于(敏感)词频(TF)的句子级评估。在使用 SotA 架构创建沿多个轴检测偏见的新模型后,我们评估了两个流行的 NLP 数据集(COPA 和 SQUAD)。作为额外贡献,我们创建了一个大型数据集(近 200 万标注样本)用于训练偏见检测模型,并公开提供。我们也公开了我们的代码。
引用
@article{arxiv.2304.04029,
title = {Bipol: A Novel Multi-Axes Bias Evaluation Metric with Explainability for NLP},
author = {Lama Alkhaled and Tosin Adewumi and Sana Sabah Sabry},
journal= {arXiv preprint arXiv:2304.04029},
year = {2023}
}
备注
Published in Elsevier's Natural Language Processing Journal