全基因组关联研究中 H1 模拟的替代方法
应用统计
2012-01-25 v1 基因组学
摘要
评估检测易感变异的统计功效在全基因组关联(GWA)研究中起着关键作用,无论是从前瞻性还是回顾性的角度来看。功效是通过在疾病模型 H1 下模拟表型来经验估计的。为此,“金”标准包括给定表型模拟基因型(例如 Hapgen)。我们在此介绍了一种在 H1 下模拟表型的替代方法,该方法不需要为每次模拟生成新的基因型。为了在固定病例总数和给定疾病模型下模拟表型,我们提出了三种算法:i) 一个简单的拒绝算法;ii) 一种数值马尔可夫链蒙特卡洛(MCMC)方法;iii) 一种精确且高效的后向采样算法。在我们的研究中,我们既在玩具数据集上验证了这三种算法,也在更真实的数据集上通过与 Hapgen 比较进行了验证。作为应用,我们随后在 1000 Genomes Project 数据集上进行了一项模拟研究,该数据集包含 629 个个体(314 个病例)和来自 X 染色体的 8,048 个 SNP。我们任意定义了一个具有两个易感 SNP 和上位效应的加性疾病模型。这三种算法结果一致,但后向采样比其他两种快得多。我们的方法也给出了与 Hapgen 一致的结果。利用我们的应用数据,我们表明我们有限的设计需要生物学先验知识来限制研究区域。我们还证明了即使使用简单的标记统计量(例如趋势检验),上位效应也能发挥重要作用。最后,我们表明 GWA 研究的整体性能强烈依赖于疾病的患病率:患病率越高,功效越好。
引用
@article{arxiv.1201.5046,
title = {Alternative Methods for H1 Simulations in Genome Wide Association Studies},
author = {Vittorio Perduca and Christine Sinoquet and Raphael Mourad and Gregory Nuel},
journal= {arXiv preprint arXiv:1201.5046},
year = {2012}
}