DPA:一种衡量分类数据集中偏差放大的一站式指标
计算机视觉与模式识别
2025-11-03 v3 机器学习
摘要
当今大多数机器学习数据集都包含偏差。当我们在这些数据集上训练模型时,它们通常不仅会学习这些偏差,还可能加剧这些偏差——这种现象被称为偏差放大。目前已提出多种基于共现的指标来衡量分类数据集中的偏差放大。它们衡量受保护属性(如性别)与任务(如烹饪)之间的偏差放大。这些指标还通过识别模型放大偏差的方向来支持细粒度的偏差分析。然而,基于共现的指标存在局限性——有些无法衡量平衡数据集中的偏差放大,而另一些则无法衡量负向偏差放大。为解决这些问题,近期工作提出了一种基于可预测性的指标,称为泄漏放大(LA)。然而,LA 无法识别模型放大偏差的方向。我们提出了方向可预测性放大(DPA),这是一种基于可预测性的指标,它具有以下特性:(1) 具有方向性,(2) 适用于平衡和不平衡数据集,(3) 正确识别正向和负向偏差放大。DPA 消除了在多个指标上评估模型以验证这三个方面的需要。DPA 还改进了 LA 等先前基于可预测性的指标:它对攻击者函数(基于可预测性指标中的一个超参数)的选择不太敏感,报告的分数在有限范围内,并通过衡量可预测性的相对变化来考虑数据集偏差。我们在 COMPAS(表格数据集)、COCO 和 ImSitu(图像数据集)等知名数据集上的实验表明,DPA 是衡量分类问题中偏差放大的最可靠指标。为了将 DPA 与现有的偏差放大指标进行比较,我们在 https://github.com/kerner-lab/Bias-Amplification 发布了一个包含主要偏差放大指标的一站式库。
引用
@article{arxiv.2412.11060,
title = {DPA: A one-stop metric to measure bias amplification in classification datasets},
author = {Bhanu Tokas and Rahul Nair and Hannah Kerner},
journal= {arXiv preprint arXiv:2412.11060},
year = {2025}
}
备注
Accepted at NeurIPS 2025