数据代表性与下游任务公平性
机器学习
2024-07-02 v1 计算机与社会
摘要
我们社会为从构建政策评估的人口普查到进行有意义的临床试验等各类应用收集人们的数据。我们通常通过抽样个体来实现对感兴趣人群的准确代表。然而,当前的抽样过程往往是机会性地从数据源中收集数据,可能导致收集的数据集偏斜且不具代表性,即收集的数据集不准确反映真实人口中人口统计特征的分布。这一问题尤为关切,因为人口中的各个子群可能在数据集中高或低地被代表,从而可能损害一般化能力,导致下游任务(如医疗决策算法中的算法偏见)中福利和伤害的分布不均。本文评估了数据代表性与在该数据集上训练的分类器公平性之间的关系。我们表明,数据代表性与分类器公平性之间存在自然的紧张关系;实证结果表明,具有更好代表性的训练数据集常常会导致分类器的不公平率更高。我们通过单变量分类器中的一组理论结果来提供一些直观解释。我们还发现,过抽样被低估的子群会导致分类器对这些子群产生更大的偏见。最后,我们观察到,公平性感知的抽样策略(即专为选择具有高下游公平性的数据而设计的策略)常常会高地抽样多数群体的成员。这些结果表明,数据代表性与下游分类器公平性之间的关系是复杂的;在两者之间进行平衡需要来自模型和数据设计者的特别注意。
引用
@article{arxiv.2407.00170,
title = {Dataset Representativeness and Downstream Task Fairness},
author = {Victor Borza and Andrew Estornell and Chien-Ju Ho and Bradley Malin and Yevgeniy Vorobeychik},
journal= {arXiv preprint arXiv:2407.00170},
year = {2024}
}
备注
48 pages, 32 figures