中文

通过最优传输克服公平性数据修复中的表示偏差

机器学习 2026-03-11 v1 计算机与社会 统计理论 统计理论

摘要

最优传输(OT)在以一种能产生公平性的方式转换数据分布方面发挥着重要作用。通常情况下,OT算子是从带有不公平属性标签的数据中学习的,然后用于进行数据修复。这一方法存在两个显著局限性:(i) 针对欠 représent 的子群的OT算子学习得不佳(即它们容易受到表示偏差的影响);以及(ii) 这些OT修复无法对在相同分布但超出样本(即档案)数据中实现。在本文中,我们通过采用贝叶斯非参数停止规则来学习每个属性标签组成的数据分布的各个组成部分,从而解决这两个问题。由此产生的OT最优量化算子然后可以用于修复档案数据。我们提出了公平分布目标的新定义,以及一些量化器,这些量化器允许我们在变换后的数据中在公平性和损伤之间进行权衡。这些都用于揭示我们表示偏差容忍方案在模拟数据集和基准数据集中的优异性能。

关键词

引用

@article{arxiv.2410.02840,
  title  = {Overcoming Representation Bias in Fairness-Aware data Repair using Optimal Transport},
  author = {Abigail Langbridge and Anthony Quinn and Robert Shorten},
  journal= {arXiv preprint arXiv:2410.02840},
  year   = {2026}
}