中文

大规模差分隐私流处理

密码学与安全 2024-07-16 v3 数据库

摘要

据我们所知,我们设计了首个大规模的差分隐私(DP)流聚合处理系统。我们的系统——差分隐私 SQL 流水线(DP-SQLP)——采用类似于 Spark streaming 的流框架构建,并基于 Google 的 Spanner 数据库与 F1 查询引擎实现。在 DP-SQLP 的设计中,我们取得了算法与系统两方面的进展,即:(i)设计了一种新颖的(用户级)DP 键选择算法,可处理无界的候选键集合,并能扩展至用户已贡献的十亿级键;(ii)设计了 DP 键选择的抢占式执行方案,避免在每次触发时枚举所有键;(iii)利用来自 DP 持续观测的算法技术,在流长度上发布用户对不同键贡献的持续 DP 直方图。我们通过实验证明,相较于所考虑的有意义基线,误差至少降低 16×16\times。我们使用 DP-SQLP 为 Google Shopping 实现了流式差分隐私用户曝光统计。该流式 DP 算法进一步应用于 Google Trends。

关键词

引用

@article{arxiv.2303.18086,
  title  = {Differentially Private Stream Processing at Scale},
  author = {Bing Zhang and Vadym Doroshenko and Peter Kairouz and Thomas Steinke and Abhradeep Thakurta and Ziyin Ma and Eidan Cohen and Himani Apte and Jodi Spacek},
  journal= {arXiv preprint arXiv:2303.18086},
  year   = {2024}
}