中文

用于数据偏差调查的特征重要性差异

机器学习 2024-06-04 v4 计算机与社会

摘要

人们普遍认为,分类器下游偏差的一个原因是训练数据中存在的偏差。纠正此类偏差可能涉及依赖具体情境的干预措施,例如在子群上分别训练模型、移除收集过程中存在偏差的特征,甚至进行真实世界实验以确定偏差来源。尽管需要进行此类数据偏差调查,但很少有自动化方法可协助从业者开展这些工作。在本文中,我们提出这样一种方法:给定由受保护特征与未受保护特征组成的数据集 XX、结果 yy,以及给定 XX 预测 yy 的回归器 hh,输出一个元组 (fj,g)(f_j, g),具有以下性质:gg 对应于训练数据集 (X,y)(X, y) 的一个子集,使得第 jj 个特征 fjf_j 在子群 gg 中的影响远大于(或远小于)在整个数据集上的影响,我们称之为特征重要性差异(FID)。我们在 44 个数据集和机器学习界广泛关注的 44 种常用特征重要性方法上表明,即使面对指数级大的子群类,我们也能高效找到具有较大 FID 值的子群,并且在实践中这些子群对应于按标准公平性指标衡量的具有潜在严重偏差问题的子群。

关键词

引用

@article{arxiv.2303.01704,
  title  = {Feature Importance Disparities for Data Bias Investigations},
  author = {Peter W. Chang and Leor Fishman and Seth Neel},
  journal= {arXiv preprint arXiv:2303.01704},
  year   = {2024}
}

备注

ICML 2024 version. 9 pages, 5 figures, 3 tables. Appendix: 18 pages, 9 figures, 4 tables