中文

合成数据能否公平且私密?合成数据生成与公平性算法的比较研究

机器学习 2026-05-21 v1 人工智能 计算机与社会

摘要

机器学习在学习分析(LA)中的应用日益增长,引发了关于算法公平性和隐私的重大关注。合成数据作为双重用途工具,既有助于提高隐私性,又有助于改善 LA 模型中的公平性。然而, prior research 指出公平性和隐私之间存在反关系,这使得优化两者变得具有挑战性。这项研究探讨了哪些合成数据生成器能够在隐私和公平性之间取得最佳平衡,以及通常应用于 real datasets 的 pre-processing 公平性算法是否在 synthetic data 上有效。我们的结果表明,DEbiasing CAusal Fairness(DECAF)算法在隐私和公平性之间取得了最佳平衡。然而,DECAF 在 utility 上存在不足,尤其是其预测准确率。值得注意的是,我们发现将 pre-processing 公平性算法应用于 synthetic data 对公平性的提升甚至超过应用于 real data。这一发现表明,将合成数据生成与公平性 pre-processing 结合起来为创建更公平的 LA 模型提供了有前景的路径。

关键词

引用

@article{arxiv.2501.01785,
  title  = {Can Synthetic Data be Fair and Private? A Comparative Study of Synthetic Data Generation and Fairness Algorithms},
  author = {Qinyi Liu and Oscar Deho and Sam Urmian and Mohammad Khalil and Srecko Joksimovic and George Siemens},
  journal= {arXiv preprint arXiv:2501.01785},
  year   = {2026}
}