中文

线性重构攻击的威力

数据结构与算法 2012-10-09 v1 密码学与安全 机器学习 概率论

摘要

我们研究了统计数据隐私中线性重构攻击的威力,表明其可应用于比以往认知更广泛的场景。此前已有研究探讨过线性攻击(Dinur 和 Nissim, PODS'03; Dwork, McSherry 和 Talwar, STOC'07; Kasiviswanathan, Rudelson, Smith 和 Ullman, STOC'10; De, TCC'12; Muthukrishnan 和 Nikolov, STOC'12),但迄今为止仅应用于发布内容显然为线性的场景。考虑一位数据库管理者,其管理着包含敏感信息的数据库,但希望发布关于数据库中某敏感属性(如疾病)与某些非敏感属性(如邮政编码、年龄、性别等)之间关系的统计数据。我们证明,基于任何提供以下内容的发布均可发起线性重构攻击:a) 满足给定非退化布尔函数的记录比例。此类发布包括列联表(Kasiviswanathan 等人,STOC'10 曾研究)以及更复杂的输出,如决策树等分类器的错误率;b) 一大类 M-估计量(即经验风险最小化算法的输出)中的任意一个,包括线性和逻辑回归的标准估计量。我们做出两项贡献:首先,我们展示了如何将这些类型的发布转换为线性格式,使其适用于现有的多项式时间重构算法。这或许令人惊讶,因为上述许多发布(如 M-估计量)是通过求解高度非线性的公式获得的。其次,我们展示了如何在各种数据分布假设下分析由此产生的攻击。具体而言,我们考虑这样一种场景:发布关于敏感属性与所有大小为 k 的非敏感布尔属性子集(总共 d 个)之间关系的相同统计数据(即上述 a) 或 b))。

关键词

引用

@article{arxiv.1210.2381,
  title  = {The Power of Linear Reconstruction Attacks},
  author = {Shiva Prasad Kasiviswanathan and Mark Rudelson and Adam Smith},
  journal= {arXiv preprint arXiv:1210.2381},
  year   = {2012}
}

备注

30 pages, to appear in ACM-SIAM Symposium on Discrete Algorithms (SODA 2013)