面向联邦统计机构的隐私保护数据分析
计算机与社会
2017-01-04 v1 密码学与安全
摘要
政府统计机构收集关于国家人口和商业活动的极具价值的数据。对这些数据的广泛访问使基于证据的政策制定成为可能,支持改善社会的新研究,促进数据科学学生的培训,并为公众更好地理解和参与其社会提供资源。这些数据也影响私营部门。例如,由劳工统计局发布的美国就业形势会推动市场。尽管如此,由于对数据隐私和机密性威胁的认识不断加深,政府机构面临着越来越大的限制数据访问的压力。事实证明,“去标识化”——去除姓名、地址和身份证号等明显标识符——在现代计算和信息资源面前是不充分的。不幸的是,这个问题甚至延伸到汇总数据统计的发布。这种违反直觉的现象被称为信息恢复基本定律。它指出,对过多统计量过于精确的估计可以完全破坏隐私。人们可以将其想象为千刀万剐。从数据集中计算的每个统计量都会泄露该数据集中每个成员的少量信息——一道微小的切口。即使为了保护隐私而对统计量的精确值进行了一点扭曲,情况也是如此。但是,虽然就任何个人的隐私风险而言,每次统计发布都几乎是一道无害的小切口,但其累积效应可能会完全损害某些个人的隐私。
引用
@article{arxiv.1701.00752,
title = {Privacy-Preserving Data Analysis for the Federal Statistical Agencies},
author = {John Abowd and Lorenzo Alvisi and Cynthia Dwork and Sampath Kannan and Ashwin Machanavajjhala and Jerome Reiter},
journal= {arXiv preprint arXiv:1701.00752},
year = {2017}
}
备注
A Computing Community Consortium (CCC) white paper, 7 pages