基于多组学数据的生存预测方法大规模基准研究
机器学习
2020-12-22 v1 机器学习
应用统计
统计方法学
摘要
多组学数据,即包含不同类型高维分子变量(通常还附加经典临床变量)的数据集,正日益被用于各种疾病的探究。然而,关于多组学数据对预测诸如生存时间等疾病结局的效用,仍存在疑问。同样不清楚的是,哪些方法最适合推导此类预测模型。我们旨在通过一项使用真实数据的大规模基准研究来回答这些问题。将机器学习和统计学中的不同预测方法应用于数据库“癌症基因组图谱”中的 18 个多组学癌症数据集,这些数据集包含 35 到 1,000 个观测以及 60,000 到 100,000 个变量。所考虑的结局为(删失的)生存时间。比较了基于提升、惩罚回归和随机森林的十二种方法,包括考虑和不考虑组学变量分组结构的方法。Kaplan-Meier 估计和仅使用临床变量的 Cox 模型被用作参考方法。采用多次重复的 5 折交叉验证对方法进行比较。Uno's C-index 和 integrated Brier-score 作为性能度量。结果表明,尽管多组学数据能够改善预测性能,但这并非普遍情况。仅 block forest 方法在所有数据集上的平均表现略优于 Cox 模型。考虑多组学结构可改善预测性能,并保护低维组(尤其是临床变量)中的变量不被排除在模型之外。所有分析均可使用免费的 R 代码复现。
引用
@article{arxiv.2003.03621,
title = {Large-scale benchmark study of survival prediction methods using multi-omics data},
author = {Moritz Herrmann and Philipp Probst and Roman Hornung and Vindi Jurinovic and Anne-Laure Boulesteix},
journal= {arXiv preprint arXiv:2003.03621},
year = {2020}
}
备注
23 pages, 6 tables, 3 figures