中文

SoK:隐私保护数据合成

密码学与安全 2023-08-08 v2 数据库 机器学习

摘要

随着数据分析的普及,保护数据隐私已成为首要关切。因此,旨在隐私保护数据分析的机制开发激增。然而,这些方法针对特定任务;为新任务设计算法过程繁琐。作为替代,可创建(理想上)不含私有信息的合成数据。本文聚焦于隐私保护数据合成(PPDS),对该领域提供全面概览、分析与讨论。具体而言,我们提出一个统一 PPDS 中两条重要研究脉络的主配方:统计方法与基于深度学习(DL)的方法。在该主配方下,我们进一步将统计方法拆解为建模与表示的选择,并依据不同生成建模原理考察基于 DL 的方法。为巩固发现,我们提供全面参考表、提炼关键要点,并指出已有文献中的开放问题。借此,我们旨在回答以下问题:不同 PPDS 方法背后的设计原理是什么?我们如何对这些方法分类,各类别的优缺点为何?我们能否为不同现实场景下的方法选择提供指南?我们接着在私有图像合成任务上基准测试若干著名基于 DL 的方法,并得出结论:DP-MERF 是一种通用方法。最后,在系统化过去十年工作的基础上,我们指明未来方向并呼吁研究者采取行动。

关键词

引用

@article{arxiv.2307.02106,
  title  = {SoK: Privacy-Preserving Data Synthesis},
  author = {Yuzheng Hu and Fan Wu and Qinbin Li and Yunhui Long and Gonzalo Munilla Garrido and Chang Ge and Bolin Ding and David Forsyth and Bo Li and Dawn Song},
  journal= {arXiv preprint arXiv:2307.02106},
  year   = {2023}
}

备注

Accepted at IEEE S&P (Oakland) 2024