中文

谱匿名化的渐近效用

密码学与安全 2024-09-19 v2 统计方法学

摘要

在以多源数据收集和第三方共享为特征的当代数据格局中,确保个人隐私是一个关键问题。尽管存在各种匿名化方法,但其效用保持和隐私保证仍然难以量化。在这项工作中,我们通过研究谱匿名化(SA)算法的效用和隐私来弥补这一差距,特别是在渐近框架下。与直接修改原始数据的传统匿名化方法不同,SA通过在谱基中扰动数据,然后将其恢复到原始基来操作。除了使用随机排列变换的原始版本P\mathcal{P}-SA之外,我们还引入了两种新的SA变体:J\mathcal{J}-谱匿名化和O\mathcal{O}-谱匿名化,它们分别采用符号变化和正交矩阵变换。我们展示了在某些实际假设下,这些SA算法在多大程度上保留了原始数据的一阶矩和二阶矩。我们的结果特别揭示了,在协方差估计中,所有三种SA算法与原始数据相比的渐近效率恰好为50%。为了评估这些渐近结果在实践中的适用性,我们进行了有限数据的模拟研究,并使用基于距离的记录链接评估了这些算法提供的隐私保护。我们的研究表明,虽然没有一种方法在有限样本效用方面表现出明显的优越性,但O\mathcal{O}-SA以其卓越的隐私保护而著称,从不产生相同的记录,尽管计算复杂度有所增加。相反,P\mathcal{P}-SA作为一种计算高效的替代方案出现,在均值估计中表现出无与伦比的效率。

关键词

引用

@article{arxiv.2405.20779,
  title  = {Asymptotic utility of spectral anonymization},
  author = {Katariina Perkonoja and Joni Virta},
  journal= {arXiv preprint arXiv:2405.20779},
  year   = {2024}
}

备注

16 pages, 6 figures