FairWASP:快速且最优的公平 Wasserstein 预处理方法
机器学习
2024-10-25 v3 机器学习
摘要
近年来,旨在减少不同子群体间模型输出差异的机器学习方法激增。在许多场景中,训练数据可能被不同用户用于多个下游应用,这意味着对训练数据本身进行干预可能最为有效。在这项工作中,我们提出 FairWASP,一种新颖的预处理方法,旨在不修改原始数据的情况下减少分类数据集中的差异。FairWASP 返回样本级权重,使得重加权后的数据集在满足(经验版本的)人口平等这一流行公平性准则的同时,最小化到原始数据集的 Wasserstein 距离。我们从理论上证明整数权重是最优的,这意味着我们的方法可等价理解为复制或删除样本。因此,FairWASP 可用于构建可输入任何分类方法的数据集,而不仅仅是接受样本权重的方法。我们的工作基于将预处理任务重新表述为一个大规模混合整数规划(MIP),为此我们提出了一种基于割平面法的高效算法。实验表明,我们提出的优化算法在求解 MIP 及其线性规划松弛时显著优于最先进的商业求解器。进一步的实验突出了 FairWASP 在减少差异的同时保持下游分类设置中准确性的竞争性能。
引用
@article{arxiv.2311.00109,
title = {FairWASP: Fast and Optimal Fair Wasserstein Pre-processing},
author = {Zikai Xiong and Niccolò Dalmasso and Alan Mishler and Vamsi K. Potluru and Tucker Balch and Manuela Veloso},
journal= {arXiv preprint arXiv:2311.00109},
year = {2024}
}
备注
AAAI 2024, 15 pages, 4 figures, 1 table