中文

认知对等:以可复现性作为差分隐私的评估指标

密码学与安全 2023-06-02 v3 计算机与社会

摘要

差分隐私 (DP) 数据合成器支持敏感信息的公开发布,提供理论上的隐私保证,但在实际场景中的效用证据有限。效用通常度量为代表性质代理任务上的误差,例如描述性统计、训练分类器的准确率或查询工作负载上的性能。这些结果推广到从业者经验的能力已在包括美国人口普查在内的多个场景中被质疑。在本文中,我们提出了一种合成数据的评估方法,该方法避免对代理任务代表性的假设,而是度量已发表结论在作者使用合成数据时是否会改变的可能性,我们将此条件称为认知对等。我们的方法包括复现同行评审论文在真实、公开可用数据上的实证结论,然后第二次在 DP 合成数据上重新运行这些实验,并比较结果。我们在一个分析 ICPSR 存储库中公开数据集的近期同行评审论文基准上实例化了我们的方法。我们对定量主张进行计算建模以自动化实验流程,并通过复现可视化并手动比较结果来对定性主张建模。然后我们使用多种最先进机制生成 DP 合成数据集,并估计这些结论成立的可能性。我们发现最先进的 DP 合成器对我们基准中的若干论文能够实现高认知对等。然而,某些论文,特别是某些具体发现,难以被任何合成器复现。我们倡导一类新的机制,其偏好更强的效用保证,并提供隐私保护,侧重于特定应用的威胁模型与风险评估。

关键词

引用

@article{arxiv.2208.12700,
  title  = {Epistemic Parity: Reproducibility as an Evaluation Metric for Differential Privacy},
  author = {Lucas Rosenblatt and Bernease Herman and Anastasia Holovenko and Wonkwon Lee and Joshua Loftus and Elizabeth McKinnie and Taras Rumezhak and Andrii Stadnik and Bill Howe and Julia Stoyanovich},
  journal= {arXiv preprint arXiv:2208.12700},
  year   = {2023}
}

备注

Preprint. 14 pages