全基因组研究中生存统计量的精确计算
定量方法
2013-09-18 v1 应用统计
摘要
基因组学中的一个关键挑战是识别能够区分诊断或治疗后具有不同生存时间患者的遗传变异。虽然 log-rank 检验广泛用于此目的,但几乎所有 log-rank 检验的实现都依赖于渐近近似,这在许多基因组学应用中并不适用。这是因为:由遗传变异确定的两个群体可能具有非常不同的大小;并且对许多可能变异的评估要求极其精确地计算非常小的 p 值。我们在癌症基因组数据中展示了这个问题,标准的 log-rank 检验导致体细胞突变与生存时间之间出现许多假阳性关联。我们开发并分析了一种新算法,即精确 Log-rank 检验 (ExaLT),该算法在适用于任何大小群体的精确分布下,精确计算 log-rank 统计量的 p 值。我们在已发表的癌症基因组研究数据上展示了 ExaLT 的优势,发现报告的 p 值存在显著差异。我们分析了来自癌症基因组图谱 (TCGA) 的六种癌症类型的体细胞突变,发现了已知与生存相关的突变以及几个新的关联。相比之下,标准 log-rank 检验实现报告了数十到数百个可能的假阳性关联,其显著性高于这些已知关联。
引用
@article{arxiv.1309.4286,
title = {Accurate Computation of Survival Statistics in Genome-wide Studies},
author = {Fabio Vandin and Alexandra Papoutsaki and Benjamin J. Raphael and Eli Upfal},
journal= {arXiv preprint arXiv:1309.4286},
year = {2013}
}
备注
Full version of RECOMB 2013 paper