从有偏数据中恢复:公平性约束能否提升准确率?
机器学习
2024-08-23 v2 人工智能
机器学习
摘要
文献中已提出多种公平性约束,其动机源于对机器学习分类器可能不公平对待不同人口群体的种种担忧。在本文中,我们考虑一种不同的动机:从有偏的训练数据中学习。我们假定训练数据可能存在多种偏差方式,包括弱势群体的标注过程更具噪声或呈负向偏差,弱势群体中正例或负例的出现频率降低,或两者兼而有之。给定此类有偏训练数据,经验风险最小化(ERM)可能产生一个不仅在真实数据分布上具有次优准确率而且有偏的分类器。我们考察了公平性约束下的 ERM 纠正这一问题的能力。具体而言,我们发现 Equal Opportunity 公平性约束(Hardt, Price, and Srebro 2016)与 ERM 结合,在一系列偏差模型下可证明地恢复贝叶斯最优分类器。我们还考虑了其他恢复方法,包括重新加权训练数据、Equalized Odds 和 Demographic Parity。这些理论结果为考虑公平性干预提供了额外的动机,即使行为者主要关心的是准确率。
引用
@article{arxiv.1912.01094,
title = {Recovering from Biased Data: Can Fairness Constraints Improve Accuracy?},
author = {Avrim Blum and Kevin Stangl},
journal= {arXiv preprint arXiv:1912.01094},
year = {2024}
}