中文

使用代表性样本审计多样性

计算机与社会 2021-07-16 v1 人工智能 机器学习

摘要

在将与人相关的信息数据集用于下游应用之前,评估其多样性至关重要。对于给定的数据集,这通常涉及计算受保护属性(例如性别、方言等)经验边际分布中的不平衡或差异。然而,现实世界的数据集,例如来自谷歌搜索的图像或推特帖子集合,通常没有标注受保护属性。因此,要为这类数据集推导差异度量,需要对元素进行人工标注或众包标注,这些是昂贵的过程。我们提出了一种经济有效的方法,利用一组带标签的代表性样本作为控制集,来近似给定无标签数据集相对于某一受保护属性的差异。我们提出的算法利用数据集中元素与控制集中元素之间的成对相似性,有效引导出对该数据集差异的近似。重要的是,我们证明使用规模远小于数据集规模的控制集就足以实现较小的近似误差。此外,基于我们的理论框架,我们还提供了一种构建自适应控制集的算法,其实现的近似误差小于随机选择的控制集。在两个图像数据集和一个推特数据集上的模拟证明了我们的方法(使用随机和自适应控制集)在审计各类数据集多样性方面的有效性。

关键词

引用

@article{arxiv.2107.07393,
  title  = {Auditing for Diversity using Representative Examples},
  author = {Vijay Keswani and L. Elisa Celis},
  journal= {arXiv preprint arXiv:2107.07393},
  year   = {2021}
}