中文

DSAP:通过数据集的人口统计比较分析偏差

计算机视觉与模式识别 2024-11-27 v1

摘要

在过去几年中,人工智能系统变得越来越普及。不幸的是,这些系统可能带有与人类决策相同的许多偏见,包括人口统计偏见。通常,这些偏见可以追溯到用于训练的数据,而大型未整理数据集已成为常态。尽管我们了解这些偏见,但仍然缺乏通用的工具来检测和量化它们,以及比较不同数据集中的偏见。因此,在这项工作中,我们提出了DSAP(来自辅助画像的人口统计相似性),这是一种用于比较两个数据集人口统计组成的两步方法。DSAP可部署在三个关键应用中:检测和表征跨数据集的人口统计盲点和偏差问题,测量单个数据集中的数据集人口统计偏差,以及测量部署场景中的数据集人口统计偏移。DSAP的一个基本特征是它能够在没有显式人口统计标签的情况下稳健地分析数据集,为各种情况提供简单性和可解释性。为了展示所提出方法的有用性,我们考虑了面部表情识别任务,其中之前已发现人口统计偏见。我们在二十个具有不同属性的数据集上研究了这三个应用。代码可在https://github.com/irisdominguez/DSAP获取。

关键词

引用

@article{arxiv.2312.14626,
  title  = {DSAP: Analyzing Bias Through Demographic Comparison of Datasets},
  author = {Iris Dominguez-Catena and Daniel Paternain and Mikel Galar},
  journal= {arXiv preprint arXiv:2312.14626},
  year   = {2024}
}

备注

18 pages, 11 figures