面向全基因组关联研究的可扩展隐私保护数据共享方法
应用统计
2014-02-10 v1
摘要
自 Homer 等人(2008)发表对 GWAS 数据的“攻击”以来,全基因组关联研究(GWAS)数据库中个体层面信息的隐私保护一直是研究人员关注的重要问题。用于统计数据库机密性与隐私保护的传统统计方法在处理 GWAS 数据时扩展性不佳,特别是在提供防止与外部信息关联的保护保证方面。由密码学社区引入的较新概念——差分隐私,是一种在存在任意外部信息时提供严格隐私定义和有意义隐私保证的方法,尽管这些保证可能以严重牺牲数据效用为代价。基于这些概念,Uhler 等人(2013)提出了在不损害个人隐私的情况下发布聚合 GWAS 数据的新方法。我们扩展了 Uhler 等人(2013)开发的方法,通过允许任意数量的病例和对照,来发布差分隐私 统计量,并用于发布差分隐私等位基因检验统计量。我们还通过假设对照数据已知提供了一种新解释,这是一个现实的假设,因为某些 GWAS 使用公开可用的数据作为对照。我们通过对由 Wellcome Trust Case Control Consortium 收集的 DNA 样本组成的真实数据集进行风险-效用分析,评估了所提方法的性能,并将这些方法与 Johnson 和 Shmatikov(2013)提出的差分隐私发布机制进行了比较。
引用
@article{arxiv.1401.5193,
title = {Scalable Privacy-Preserving Data Sharing Methodology for Genome-Wide Association Studies},
author = {Fei Yu and Stephen E. Fienberg and Aleksandra Slavković and Caroline Uhler},
journal= {arXiv preprint arXiv:1401.5193},
year = {2014}
}
备注
28 pages, 2 figures, source code available upon request