中文

基于大规模生存数据的风险预测建模机器学习方法综合基准测试:一项 UK Biobank 研究

机器学习 2025-03-13 v1 应用统计

摘要

预测建模对于指导预防工作至关重要。尽管大规模前瞻性队列研究和丰富的可用机器学习(ML)算法工具包促进了此类生存分析任务的开展,但选择性能最佳的算法仍具挑战。迄今为止的基准测试研究集中于相对小规模的数据集,尚不清楚这些发现能在多大程度上适用于结合了组学与临床特征的大型数据集。我们旨在大规模前瞻性队列研究 UK Biobank(UKB)中,对从线性模型到深度学习(DL)模型等八种不同的生存分析任务实现进行基准测试。我们比较了异构预测矩阵和终点之间的区分度与计算需求。最后,我们评估了不同架构在样本量从 n = 5,000 到 n = 250,000 个体时的扩展能力。结果表明,多种指标下的判别性能取决于终点频率和预测矩阵属性,且(惩罚型)COX 比例风险(COX-PH)模型表现出非常稳健的性能。值得注意的是,在某些特定场景下更倾向于使用更复杂的框架,特别是在处理大量观测值和相对简单的预测矩阵时。观测到的计算需求差异巨大,我们在当前实现不可行的情况下提供了解决方案。总之,这项工作阐明了最优模型的选择如何依赖于多种因素,包括样本量、终点频率和预测矩阵属性,从而为在类似数据集上工作的研究人员构成了一个信息丰富的资源。此外,我们展示了线性模型如何依然提供一个高度有效且可扩展的平台以进行大规模风险建模,并建议将其与非线性 ML 模型一并报告。

关键词

引用

@article{arxiv.2503.08870,
  title  = {Comprehensive Benchmarking of Machine Learning Methods for Risk Prediction Modelling from Large-Scale Survival Data: A UK Biobank Study},
  author = {Rafael R. Oexner and Robin Schmitt and Hyunchan Ahn and Ravi A. Shah and Anna Zoccarato and Konstantinos Theofilatos and Ajay M. Shah},
  journal= {arXiv preprint arXiv:2503.08870},
  year   = {2025}
}