中文

关于美国人口普查重识别攻击被误读的说明

密码学与安全 2022-09-27 v2

摘要

2018 年,美国人口普查局设计了一种新的数据重建与重识别攻击,并针对其 2010 年发布的数据进行了测试。该局执行的这一特定攻击允许攻击者推断受访者的种族和民族,假设攻击者已知受访者的正确年龄、性别和地址,对 85% 的受访者平均推断精度可达 75%。他们将该攻击解读为超出了该局的隐私标准,因此以 TopDown 算法(TDA)的形式为 2020 年人口普查引入了更强的隐私保护。本文证明,使用更少的先验知识——仅凭受访者的地址,就能从受 TDA 保护的人口普查数据中以显著更高的精度和召回率推断出种族和民族。对 98% 的受访者,种族和民族可以平均 75% 的精度被推断出来;对 11% 的受访者,则可以 100% 的精度被推断出来。这种推断只需简单地假设受访者的种族/民族是其所在人口普查区块的多数种族/民族即可完成。从这一简单演示中得出的结论并非该局的数据发布缺乏足够的隐私保护。事实上,允许此类推断正是数据发布的目的所在。问题在于,该局衡量隐私的标准存在缺陷且过于悲观。

关键词

引用

@article{arxiv.2202.04872,
  title  = {A Note on the Misinterpretation of the US Census Re-identification Attack},
  author = {Paul Francis},
  journal= {arXiv preprint arXiv:2202.04872},
  year   = {2022}
}

备注

PSD 2022