癌症体细胞突变研究中的错误发现率
摘要
癌症基因组测序研究的目的是确定典型癌症中存在的变异性质与类型,并发现高频突变的基因。本文讨论这些研究中产生的体细胞突变频率数据的统计分析方法。我们特别关注 Sjöblom 等人 [Science 314 (2006) 268--274] 引入的两阶段研究设计。在此背景下,我们描述并比较了用于构建评分的统计方法,这些评分可用于对候选基因进行优先排序以开展进一步研究,并评估由此识别出的候选基因的统计显著性。早期癌症基因组研究中所用近似方法提供的错误发现率估计值的可靠性一直存在争议。为解决这些问题,我们开发了一个半参数贝叶斯模型,该模型能精确拟合数据。我们使用该模型生成大量符合实际的场景,并在此场景集合上评估替代方法。我们的评估是公正的,因为用于生成数据的模型未被任何所比较的方法使用;同时也是客观的,因为场景是由拟合数据的模型生成的。我们的结果量化了 Benjamini 和 Hochberg 方法相较于经验贝叶斯方法及 Storey [J. R. Stat. Soc. Ser. B Stat. Methodol. 64 (2002) 479--498] 中提出的多重检验方法,对错误发现率的保守控制程度。模拟结果还显示,Sjöblom 等人 [Science 314 (2006) 268--274] 所使用的方法与目标错误发现率的偏离可忽略不计。
引用
@article{arxiv.1107.4843,
title = {False discovery rates in somatic mutation studies of cancer},
author = {Lorenzo Trippa and Giovanni Parmigiani},
journal= {arXiv preprint arXiv:1107.4843},
year = {2011}
}
备注
Published in at http://dx.doi.org/10.1214/10-AOAS438 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)