快速且准确的汇总统计量插补增强了功能富集的证据
定量方法
2014-07-03 v1 基因组学
种群与进化
应用统计
摘要
利用外部参考面板进行插补是一种广泛用于提高全基因组关联研究 (GWAS) 和荟萃分析统计效力的方法。现有的基于隐马尔可夫模型 (HMM) 的插补方法需要个体水平的基因型数据。在此,我们开发了一种新的从汇总关联统计量进行高斯插补的方法,这类数据正变得日益普及。在使用 1000 Genomes (1000G) 数据的模拟中,该方法恢复了常见变异 (>5%) 和低频率变异 (1-5%) 84% (54%) 的有效样本量(当目标样本提供汇总连锁不平衡信息时,这一比例增至 87% (60%)),而基于 HMM 的插补(无法应用于汇总统计量)分别为 89% (67%)。我们的方法考虑了参考面板有限的样本量,这是消除假阳性关联的关键步骤,且计算速度极快。作为实证演示,我们将该方法应用于来自 WTCCC 数据的 7 种病例 - 对照表型以及英国 1958 年出生队列 (1958BC) 的身高研究。与基于个体水平基因型的 HMM 插补相比,从汇总统计量进行的高斯插补在 WTCCC (1958BC 身高) 数据已发表的 227 (176) 个 SNP 位点上,恢复了 95% (105%) 的有效样本量(通过 关联统计量的比率量化)。此外,针对来自 4 种脂质性状大型荟萃分析的公开可用汇总统计量,我们公开发布了 1000G SNP 位点的插补汇总统计量,这些数据无法使用先前发表的方法获得,并通过掩蔽部分数据证明了其准确性。我们表明,与未进行 1000G 插补的分析相比,使用我们方法进行 1000G 插补增加了这些性状在基因座与非基因座位点富集的幅度和统计证据。因此,汇总统计量的插补将成为未来功能富集分析中有价值的工具。
引用
@article{arxiv.1309.3258,
title = {Fast and accurate imputation of summary statistics enhances evidence of functional enrichment},
author = {Bogdan Pasaniuc and Noah Zaitlen and Huwenbo Shi and Gaurav Bhatia and Alexander Gusev and Joseph Pickrell and Joel Hirschhorn and David P Strachan and Nick Patterson and Alkes L. Price},
journal= {arXiv preprint arXiv:1309.3258},
year = {2014}
}
备注
32 pages, 4 figures