中文

FairBalance:如何通过数据预处理实现均等几率

机器学习 2024-08-22 v5

摘要

本研究旨在通过提供一种简单而有效的预处理方法,在机器学习软件中实现均等几率公平性,从而惠及软件工程界。随着机器学习软件越来越多地用于高风险和关键决策,公平性问题已引起越来越多的关注。在所有现有的公平性概念中,本工作特别针对“均等几率”,因其在始终允许完美分类器方面的优势。均等几率要求每个 demographic 群体的成员不受到不同的错误对待。先前的工作要么像黑盒一样在学习过程中优化与均等几率相关的度量,要么凭直觉操纵训练数据。本工作研究均等几率被违反的根本原因及如何应对。我们发现,在不修改正常训练过程的情况下实现均等几率,以样本权重均衡每个 demographic 群体中的类别分布是一个必要条件。此外,当类别分布被加权为不仅相等而且平衡(1:1)时,可以保证均等几率的一个重要部分条件(零平均几率差异)。基于这些分析,我们提出了 FairBalance,一种通过对训练数据分配计算所得权重来均衡每个 demographic 群体中类别分布的预处理算法。在八个真实世界数据集上,我们的实证结果表明,在低计算开销下,所提出的预处理算法 FairBalance 能显著改善均等几率,而对效用的损害很小甚至没有。FairBalance 在均等几率方面也优于现有的最先进方法。为便于复用、复现和验证,我们将脚本发布于 https://github.com/hil-se/FairBalance。

关键词

引用

@article{arxiv.2107.08310,
  title  = {FairBalance: How to Achieve Equalized Odds With Data Pre-processing},
  author = {Zhe Yu and Joymallya Chakraborty and Tim Menzies},
  journal= {arXiv preprint arXiv:2107.08310},
  year   = {2024}
}

备注

16 pages. Accepted by TSE