面向社会公益的合成数据
计算机与社会
2017-10-25 v1
摘要
数据公益意味着对数据的无限制访问。但数据所有者必须对共享数据的方式、时机和原因保持谨慎,否则可能违背其旨在帮助的人们的信任、失去资金或违反法律。数据共享协议有助于防止隐私侵犯,但要求的特定性在初步讨论时显得过早,且可能需要一年多才能建立。我们考虑生成和使用合成数据,以促进涉及敏感数据的临时协作。一个好的合成数据集具有两个特性:它能代表原始数据,并且提供关于隐私的强有力保证。在本文中,我们讨论了合成数据的重要用例,这些用例对隐私保护数据生成中的现有技术水平提出挑战,并描述了 DataSynthesizer——一个将敏感数据集作为输入并生成在结构和统计上相似且具强隐私保证的合成数据集作为输出的数据集生成工具。数据所有者无需发布其数据,而潜在合作者可以开始开发模型和方法,并有一定信心其结果在真实数据集上表现相似。DataSynthesizer 的显著特征是其易用性——在大多数情况下,数据所有者无需指定任何参数即可开始安全有效地生成和共享数据。实现 DataSynthesizer 的代码已在 GitHub 上公开:https://github.com/DataResponsibly。DataSynthesizer 的工作是 Data, Responsibly 项目的一部分,该项目旨在将数据共享、集成、分析和使用中的责任操作化。
引用
@article{arxiv.1710.08874,
title = {Synthetic Data for Social Good},
author = {Bill Howe and Julia Stoyanovich and Haoyue Ping and Bernease Herman and Matt Gee},
journal= {arXiv preprint arXiv:1710.08874},
year = {2017}
}
备注
Presented at the Data For Good Exchange 2017