LSMM:一种将功能注释与全基因组关联研究相结合的统计方法
统计方法学
2017-10-20 v1 基因组学
摘要
全基因组关联研究(GWAS)已鉴定出数千个影响复杂表型(数量性状和疾病)的风险变异。然而,在加深我们对复杂表型遗传结构的理解方面,仍存在两大挑战。首先,大多数 GWAS 发现位于非编码区,其生物学解释仍不清楚。其次,来自 GWAS 的累积证据表明复杂性状具有多基因性,即一个复杂性状通常受许多具有微小或中等效应的变异影响,而大量具有微小效应的风险变异仍属未知。功能注释数据的可用性使我们能够应对上述挑战。在本研究中,我们提出了一种潜在稀疏混合模型(LSMM),以整合功能注释与 GWAS 数据。它不仅提高了识别风险变异的统计功效,还通过检测相关的功能注释提供了更多的生物学见解。为使 LSMM 能够扩展到数百万个变异和数百个功能注释,我们开发了一种高效的变分期望最大化(EM)算法用于模型参数估计和统计推断。我们首先进行了全面的模拟研究以评估 LSMM 的性能。然后,我们将其应用于分析 30 个复杂表型的 GWAS,并整合了来自 Roadmap 项目的 9 个基因类别注释和 127 个组织特异性功能注释。结果表明,我们的方法比传统方法具有更强的统计功效,并能帮助研究人员更深入地理解这些复杂表型的遗传结构。
引用
@article{arxiv.1710.07201,
title = {LSMM: A statistical approach to integrating functional annotations with genome-wide association studies},
author = {Jingsi Ming and Mingwei Dai and Mingxuan Cai and Xiang Wan and Jin Liu and Can Yang},
journal= {arXiv preprint arXiv:1710.07201},
year = {2017}
}