基于成对残差差值和生存集成模型及其在肺癌微阵列研究中的应用
应用统计
2011-08-10 v1
摘要
就发病率和死亡率而言,肺癌是美国最常见的癌症之一。据估计,2009 年仅肺癌就将导致超过 15 万人死亡。遗传信息是表征癌症个体特性的极有价值的数据来源。在过去几年中,研究者开展了大量关联研究,在这些研究中,相对于基因预测变量的数量,收集了相对较少患者的密集遗传数据,其科学目标之一是识别与癌症复发或生存相关的遗传特征。在本注记中,我们通过 boosting 这一机器学习中的强大工具的一种新应用,提出高维生存分析方法。我们的方法基于加速寿命模型,并最小化成对残差的差值和。我们将该方法应用于一项最近的肺腺癌微阵列研究,发现我们的集成模型由 19 个基因组成,而比例风险 (PH) 集成模型由 9 个基因组成,后者是 19 基因面板的一个真子集。在我们的一个模拟场景中,我们证明,在模型误设的情况下,PH boosting 倾向于欠拟合,并平均而言忽略中等大小的协变量效应。诊断分析表明,该微阵列数据不满足 PH 假设,这可能部分解释了活跃系数集合的差异。我们的模拟研究和比较数据分析表明,仅通过 PH 模型进行统计学习是不够的。
引用
@article{arxiv.1108.1885,
title = {Survival ensembles by the sum of pairwise differences with application to lung cancer microarray studies},
author = {Brent A. Johnson and Qi Long},
journal= {arXiv preprint arXiv:1108.1885},
year = {2011}
}
备注
Published in at http://dx.doi.org/10.1214/10-AOAS426 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)