中文

公平且明智地花费隐私预算

机器学习 2022-08-11 v1 密码学与安全

摘要

差分隐私(DP)合成数据生成是一种改善数据访问的实用方法,旨在鼓励富有成效的合作。差分隐私固有的一个问题是,“隐私预算”通常被“均匀地”花费在数据集中的各个特征上。这导致合成数据与真实数据具有良好的统计一致性,但可能低估了对于合成数据预测质量至关重要的条件概率和边际概率。此外,预测质量的损失在数据集中可能是不均匀的,对应于少数群体的子集可能遭受更高的损失。在本文中,我们开发了集成方法,以“明智地”分配隐私预算,从而最大化在DP数据上训练的模型的预测准确性,并“公平地”分配以限制不同群体间准确性的潜在差异并减少不平等。我们的方法基于以下见解:特征重要性可以指导隐私预算的分配,并且进一步地,每个群体的特征重要性和与公平性相关的性能目标可以被纳入分配过程。这些见解使我们的方法可调整以适应社会背景,允许数据所有者生成用于预测分析的平衡合成数据。

关键词

引用

@article{arxiv.2204.12903,
  title  = {Spending Privacy Budget Fairly and Wisely},
  author = {Lucas Rosenblatt and Joshua Allen and Julia Stoyanovich},
  journal= {arXiv preprint arXiv:2204.12903},
  year   = {2022}
}