中文

面向公平性的最优传输:使用小型研究数据集的档案数据修复

机器学习 2024-03-22 v1 计算机与社会 统计理论 统计理论

摘要

随着 AI 法案及其他法规的出现,目前迫切需要能够修复训练数据中不公平性的算法。在本文中,我们将公平性定义为在给定非保护属性(UU)的情况下,保护属性(SS)与特征(XX)之间的条件独立性。我们处理了这样一种重要场景:需要修复大量档案数据,但仅使用其中一小部分带有 SUS|U 标签的数据(即研究数据)。我们利用后者在插值支撑上设计基于最优传输(OT)的修复计划。这使得带标签的离样本档案数据能够在平稳性假设下得到修复。它还显著减小了 OT 计划支撑的规模,相应地大幅节省了其设计成本及其对离样本数据进行序列化应用的成本。我们提供了使用模拟数据和真实基准数据(Adult 数据集)的详细实验结果。我们的性能数据表明,对大量离样本、带标签的(档案)数据实现了有效修复——即抑制了条件依赖。

关键词

引用

@article{arxiv.2403.13864,
  title  = {Optimal Transport for Fairness: Archival Data Repair using Small Research Data Sets},
  author = {Abigail Langbridge and Anthony Quinn and Robert Shorten},
  journal= {arXiv preprint arXiv:2403.13864},
  year   = {2024}
}