公平性约束能在多大程度上帮助从有偏数据中恢复?
机器学习
2024-06-04 v4 人工智能
摘要
公平分类中的一个普遍观点是,公平性约束会导致与准确率的权衡,而有偏数据可能会加剧这一权衡。与该观点相反,Blum & Stangl (2019) 表明,即使在极度有偏的数据上施加机会均等约束的公平分类,也能在原始数据分布上恢复出最优准确且公平的分类器。他们的结果非常有趣,因为它表明公平性约束能够隐式地纠正数据偏差,并同时克服所感知的公平性与准确率之间的权衡。他们的数据偏差模型模拟了弱势群体中的代表性不足与标签偏差,并在具有独立同分布(i.i.d.)标签噪声的风格化数据分布上,在关于数据分布和偏差参数的简单条件下展示了上述结果。我们提出了一种通用方法,将 Blum & Stangl (2019) 的结果扩展到不同的公平性约束、数据偏差模型、数据分布和假设类。我们加强了他们的结果,并将其扩展到其风格化分布的标签具有 Massart 噪声而非独立同分布噪声的情况。我们使用公平拒绝选项分类器,证明了对于任意数据分布的类似恢复结果。我们进一步将其推广到任意数据分布和任意假设类,即我们证明,对于任何数据分布,如果给定假设类中最优准确的分类器是公平且鲁棒的,那么只要偏差参数满足某些简单条件,它就可以通过对有偏分布施加机会均等约束的公平分类来恢复。最后,我们展示了我们的技术在分类和公平机器学习管线中时变数据偏差的应用。
引用
@article{arxiv.2312.10396,
title = {How Far Can Fairness Constraints Help Recover From Biased Data?},
author = {Mohit Sharma and Amit Deshpande},
journal= {arXiv preprint arXiv:2312.10396},
year = {2024}
}
备注
Accepted for publication at ICML 2024