部分缺失多组学协变量数据的预测方法:文献综述与实证比较研究
基因组学
2023-02-09 v1 人工智能
机器学习
应用统计
统计计算
摘要
随着近年来组学数据可用性的增加,产生了更多多组学数据,即由基因组、转录组或蛋白质组等多种类型组成的高维分子数据,且均来自同一患者。此类数据适合作为自动结局预测中的协变量,因为每种组学类型可能贡献独特信息,相较于仅使用一种组学数据类型,有可能改善预测。然而,在训练数据以及应应用自动预测规则的测试数据中,不同组学数据类型常并非对所有患者都可用。我们将此类数据称为分块缺失多组学数据。首先,我们针对适用于此类数据的现有预测方法提供文献综述。随后,利用 13 个公开可用的多组学数据集,我们比较了若干方法在不同分块缺失模式下的预测表现。最后,我们讨论该实证比较研究的结果并得出一些初步结论。
引用
@article{arxiv.2302.03991,
title = {Prediction approaches for partly missing multi-omics covariate data: A literature review and an empirical comparison study},
author = {Roman Hornung and Frederik Ludwigs and Jonas Hagenberg and Anne-Laure Boulesteix},
journal= {arXiv preprint arXiv:2302.03991},
year = {2023}
}