利用广义线性模型在全基因组关联研究中进行高效有力的族错误率控制
统计方法学
2020-04-13 v2 应用统计
摘要
在遗传关联研究中,检测表型-基因型关联是主要目标。我们假设数据——表型、遗传标记和环境协变量——之间的关系可由广义线性模型(GLM)建模。环境协变量的纳入使得考虑重要混杂因素成为可能,例如性别与群体亚结构。一个多元得分统计量,在无非表型-基因型关联的完全零假设下渐近地具有多元正态分布,其协方差矩阵可从数据估计,被用于检验大量遗传标记与表型的关联。我们强调控制族错误率(FWER)的重要性,并利用多元得分检验统计量的渐近分布为单个检验寻找局部显著性水平。利用真实数据(来自一项关于精神分裂症与双相情感障碍的研究以及一项关于最大摄氧量的研究)和构建的相关结构,我们表明我们的方法是流行的 Bonferroni 和 Sidak 方法的有力替代。对于不含环境协变量的GLM,我们表明我们的方法是多重检验置换方法的高效替代。进一步,我们表明若环境协变量与遗传标记不相关,则得分检验统计量的估计协方差矩阵可由仅遗传标记的估计相关矩阵近似。作为我们方法的副产品,可定义独立检验的有效数目,并且可计算FWER调整的 -值作为使用局部显著性水平的替代。
引用
@article{arxiv.1603.05938,
title = {Efficient and powerful familywise error control in genome-wide association studies using generalized linear models},
author = {K. K. Halle and Ø. Bakke and S. Djurovic and A. Bye and E. Ryeng and U. Wisløff and O. A. Andreassen and M. Langaas},
journal= {arXiv preprint arXiv:1603.05938},
year = {2020}
}