在异质性人类群体中实现隐私保护的 GWAS
定量方法
2016-04-18 v1 应用统计
摘要
临床中基因分型预期增长以及大型基因组数据库的兴起,使得利用患者医疗数据以空前规模和低成本开展全基因组关联研究(GWAS)成为可能。然而,由于隐私问题,该数据的访问仅限于少数可信个体,极大降低了其对生物医学研究的影响。隐私保护方法被提出作为在保护患者的同时允许更多人访问这些宝贵数据的途径。特别是,将差分隐私概念应用于 GWAS 结果日益受到关注。遗憾的是,先前执行差分隐私 GWAS 的方法基于较为简单的统计量,存在一些重大局限。尤其是,它们未对群体分层进行校正,而这是处理现代 GWAS 中遗传多样性群体时的一个主要问题。为解决此问题,我们引入了一种新颖的计算框架来进行 GWAS,该框架调整差分隐私思想以保护私有表型信息,同时校正群体分层。该框架使我们能够基于两种最常用的 GWAS 统计量生成隐私保护的 GWAS 结果:EIGENSTRAT 和基于线性混合模型(LMM)的统计量。我们在模拟和真实 GWAS 数据集上测试了我们的差分隐私统计量 PrivSTRAT 和 PrivLMM,发现它们能够在保护隐私的同时返回有意义的 GWAS 结果。
引用
@article{arxiv.1604.04484,
title = {Enabling Privacy-Preserving GWAS in Heterogeneous Human Populations},
author = {Sean Simmons and Cenk Sahinalp and Bonnie Berger},
journal= {arXiv preprint arXiv:1604.04484},
year = {2016}
}
备注
To be presented at RECOMB 2016