中文

一种用于修复偏差数据以实现算法公平性的最优传输平滑插值方法

应用统计 2025-03-20 v1

摘要

算法偏差是基于人工智能的决策过程中的热门话题,尤其是在性别、年龄或族裔等人口统计学特征介入时。问题往往不仅在于算法本身,还在于喂养算法的有偏数据——这仅仅是社会偏差的反映。因此,需要修复提供给算法的"数据",以产生对所有群体均无偏差的结果。作为简单但常见的情形,考虑两个不同的子群:特权群体和非特权群体。假设结果不应依赖于这种划分数据的特征,则每个群体中其余属性的取值需要被移动(传输),使其底层分布可被视为相似。为此,利用最优传输(OT)理论,将除敏感变量外的特征值有效地传输到两个按群体条件分布各自的Wasserstein重心。一种基于拍卖算法的高效过程被适配用于此目的。传输针对手头数据进行。如果新数据到达,则OT问题需对新数据集(包含先前和 incoming 数据)重新求解,这相当低效。作为替代,本文提出了一种称为扩展总修复(Extended Total Repair, ExTR)的平滑插值过程的实现,这是论文的主要贡献之一。该方法在模拟有偏数据以及用于风险评估预测的德国信贷数据集的真实案例上均取得了满意的结果。

关键词

引用

@article{arxiv.2503.15119,
  title  = {A proposal of smooth interpolation to optimal transport for restoring biased data for algorithmic fairness},
  author = {Elena M. De Diego and Paula Gordaliza and Jesús Lopez-Fidalgo},
  journal= {arXiv preprint arXiv:2503.15119},
  year   = {2025}
}

备注

25 pages (18 main document + 7 appendix and references), 7 figures, 5 tables