协方差损失的代价即隐私的收益:计算高效、具隐私保障且准确的合成数据
密码学与安全
2022-08-11 v2 概率论
统计理论
统计理论
摘要
私人信息的保护在数据驱动的研究、商业和政府中至关重要。隐私与效用之间的冲突引发了计算机科学和统计学界的深入研究,他们已开发出多种用于隐私保护数据发布的方法。涌现的主要概念包括匿名化和差分隐私。如今,另一种解决方案正获得关注,即合成数据。然而,通往隐私之路铺满了 NP 难问题。在本文中,我们聚焦于一个 NP 难挑战:开发一种计算高效、带有可证明隐私保障并能严格量化数据效用的合成数据生成方法。我们通过研究概率论中一个基础但乍看完全无关的问题——关于协方差损失概念的问题,来求解该问题的松弛版本。具体而言,我们对“取条件期望时会损失多少信息”这一问题给出了近乎最优且可构造的回答。令人惊讶的是,这次理论概率的涉足所产生的数学技术,使我们能够为涉及微聚合、隐私和合成数据的困难应用问题推导出可构造的近似最优解。
引用
@article{arxiv.2107.05824,
title = {Covariance's Loss is Privacy's Gain: Computationally Efficient, Private and Accurate Synthetic Data},
author = {March Boedihardjo and Thomas Strohmer and Roman Vershynin},
journal= {arXiv preprint arXiv:2107.05824},
year = {2022}
}