中文

在哪里干预?不同差异性私有合成表格数据上的公平性感知学习基准测试

机器学习 2026-07-08 v1 人工智能 密码学与安全

摘要

机器学习模型越来越多地部署在高风险领域,引发了对隐私和公平性的担忧。差分隐私(DP)已成为隐私保护数据分析的黄金标准,而公平性机制旨在缓解对代表性不足群体的歧视。然而,这些目标可能存在冲突:DP往往会放大不同人口群体之间的差异,而且关于公平性干预在DP约束下是否仍然有效知之甚少。在本工作中,我们首次系统评估了差异性私有合成表格数据上的公平性干预。我们的基准测试以自适应迭代机制(AIM)为核心,该机制被确定为最先进的边际型DP合成器(Cormode等,2025年)。因此,我们在四个数据集上评估公平性干预,使用多种公平性指标和三种缓解策略(预处理、内部处理和后期处理),并在广泛的隐私预算范围内进行比较。我们评估了四种流水线配置:(基线)在原始数据上训练;(仅DP)在DP合成数据上训练;(仅公平性)在原始数据上应用公平性机制;(DP+公平)结合公平性机制与DP合成数据。我们的结果表明,虽然DP单独可能损害效用和公平性,但应用公平性干预可以部分恢复公平结果。其中,后处理方法的公平性-效用权衡在不同隐私预算和合成器之间更为稳定,在保持竞争性效用的同时实现强大的公平性改进。我们将所有代码、数据和实验产物发布在开源仓库中,以确保完全可重复性,并支持未来关于隐私-公平性-效用权衡的研究。

关键词

引用

@article{arxiv.2607.07471,
  title  = {Where to Intervene? Benchmarking Fairness-Aware Learning on Differentially Private Synthetic Tabular Data},
  author = {Vinícius Gabriel Angelozzi and Héber H. Arcolezi},
  journal= {arXiv preprint arXiv:2607.07471},
  year   = {2026}
}

备注

Paper accepted at PETS 2026. Code is available at https://github.com/vinicius-verona/dp-fair-intervention-benchmark