遗传关联研究中疾病 - 基因型关联的稳健方法:使用精确条件枚举而非渐近近似计算 P 值
统计方法学
2020-04-13 v1 应用统计
摘要
在遗传关联研究中,检测疾病与基因型的关联是主要目标。对于大多数疾病,其潜在的遗传模型是未知的,我们研究了七种用于单调关联的稳健检验统计量。对于给定的检验统计量,计算 p 值的方法有很多,但在遗传关联研究中,计算主要基于渐近近似或模拟置换。我们表明,当置换次数趋于无穷大时,置换 p 值趋近于精确条件枚举 p 值,并且进一步证明计算后者比执行模拟置换效率高得多。随后我们回答了两个研究问题:(i) 在所研究的检验统计量中,哪些对于单调遗传模型具有最高的功效?(ii) 基于检验水平、功效和计算考量,应使用渐近近似还是精确条件枚举来计算 p 值?我们研究了病例数为 500-5000、对照数为 500-15000 的病例 - 对照样本量,以及从 5e-8 到 0.05 的显著性水平,因此我们的结果适用于仅研究一个遗传标记的遗传关联研究、中期随访研究以及全基因组关联研究。我们发现,如果关注所有单调遗传模型,则基于不同评分的 Cochran-Armitage 趋势检验最大值构建的检验统计量以及约束似然比检验能达到最佳性能。对于低于 0.05 的显著性水平,渐近近似给出的检验水平可能高达名义水平的 20 倍,因此应谨慎使用。此外,基于精确条件枚举计算 p 值是一种功效高、有效且计算可行的方法,我们提倡在遗传关联研究中使用该方法。
引用
@article{arxiv.1307.7536,
title = {Robust Methods for Disease-Genotype Association in Genetic Association Studies: Calculate P-values Using Exact Conditional Enumeration instead of Asymptotic Approximations},
author = {Mette Langaas and Øyvind Bakke},
journal= {arXiv preprint arXiv:1307.7536},
year = {2020}
}