如何实现公平?一项关于标签与选择偏差的研究
机器学习
2024-03-26 v1 人工智能
计算机与社会
摘要
人们普遍认为,有偏数据会导致有偏乃至潜在不公平的模型。因此,已提出多种衡量数据与模型预测偏差的指标,以及旨在通过设计学习公平模型的偏差缓解技术。然而,尽管过去十年间涌现了大量缓解技术,人们仍不甚清楚在何种情况下哪些方法有效。近期,Wick 等人通过合成数据实验表明,存在偏差缓解技术能在无偏数据上产生更准确模型的情形。然而,在缺乏深入数学分析的情况下,仍不清楚哪些技术在何种条件下有效。我们提议通过建立偏差类型与缓解技术有效性之间的关系来解决这一问题,其中我们按技术所优化的偏差指标对其进行分类。本文以标签偏差和选择偏差为一方,以人口均等和“人人平等”为另一方,阐释这一原理。我们的理论分析能够解释 Wick 等人的结果,并且我们还表明,存在最小化公平性指标并不会产生最公平可能分布的情形。
引用
@article{arxiv.2403.14282,
title = {How to be fair? A study of label and selection bias},
author = {Marco Favier and Toon Calders and Sam Pinxteren and Jonathan Meyer},
journal= {arXiv preprint arXiv:2403.14282},
year = {2024}
}