论稀疏向量技术变体的隐私性质
数据库
2015-08-31 v1 密码学与安全
摘要
稀疏向量技术是一种强大的差分隐私原语,允许分析者检查流中的查询是大于还是小于阈值。该技术具有一个独特性质——算法通过向查询和阈值添加具有有限方差的噪声来工作,并保证隐私仅随 流中任一查询的最大敏感度,以及 算法输出的肯定答案数量 而退化。最近的工作开发了该算法的变体,我们称之为“广义私有阈值测试”,并声称其具有不依赖于算法输出的肯定或否定答案数量的隐私保证。在给定隐私预算下,这些算法在效用上比稀疏向量技术有显著改善,并已应用于频繁项集挖掘、机器学习中的特征选择以及合成数据生成。在本文中,我们批判性地分析了广义私有阈值测试的隐私性质。我们证明广义私有阈值测试对于任何有限的 \epsilon 都不满足 \epsilon-差分隐私。我们在先前工作中发现了该技术隐私分析中的一个微妙错误。此外,我们表明对手可以利用广义私有阈值测试高精度地从数据集中准确恢复计数(尤其是小计数),从而导致个体被重新识别。我们在真实数据集上实证展示了我们的攻击。
引用
@article{arxiv.1508.07306,
title = {On the Privacy Properties of Variants on the Sparse Vector Technique},
author = {Yan Chen and Ashwin Machanavajjhala},
journal= {arXiv preprint arXiv:1508.07306},
year = {2015}
}
备注
8 pages