中文

部分缺失多组学协变量数据的预测方法:文献综述与实证比较研究

基因组学 2023-02-09 v1 人工智能 机器学习 应用统计 统计计算

摘要

随着近年来组学数据可用性的增加,产生了更多多组学数据,即由基因组、转录组或蛋白质组等多种类型组成的高维分子数据,且均来自同一患者。此类数据适合作为自动结局预测中的协变量,因为每种组学类型可能贡献独特信息,相较于仅使用一种组学数据类型,有可能改善预测。然而,在训练数据以及应应用自动预测规则的测试数据中,不同组学数据类型常并非对所有患者都可用。我们将此类数据称为分块缺失多组学数据。首先,我们针对适用于此类数据的现有预测方法提供文献综述。随后,利用 13 个公开可用的多组学数据集,我们比较了若干方法在不同分块缺失模式下的预测表现。最后,我们讨论该实证比较研究的结果并得出一些初步结论。

关键词

引用

@article{arxiv.2302.03991,
  title  = {Prediction approaches for partly missing multi-omics covariate data: A literature review and an empirical comparison study},
  author = {Roman Hornung and Frederik Ludwigs and Jonas Hagenberg and Anne-Laure Boulesteix},
  journal= {arXiv preprint arXiv:2302.03991},
  year   = {2023}
}