中文

在存在无标签数据的情况下预测生存结果

机器学习 2022-10-26 v1 人工智能 机器学习

摘要

许多临床研究需要对患者进行长期随访。这极具挑战性:除了经常观察到的退出外,通常还存在组织和财务上的挑战,这可能导致数据收集减少,进而使后续分析复杂化。相比之下,通常有大量具有相似特征和背景信息的患者基线数据可用,例如来自研究时间窗口之外的患者。在本文中,我们调查了是否可以通过包含此类无标签数据实例来预测准确的生存时间并从中受益。换言之,我们在生存分析的背景下引入了第三层监督,除了完全观测和删失实例外,我们还包含了无标签实例。我们提出了三种方法来处理这一新设置,并在十五个真实临床和基因表达生存数据集上进行了经验比较。我们的结果表明,所有方法都能够提高在独立测试数据上的预测性能。我们还表明,在半监督包装器方法中整合删失数据提供的部分监督通常能提供最佳结果,与不使用无标签数据相比,往往能获得很高的提升。

关键词

引用

@article{arxiv.2210.13891,
  title  = {Predicting Survival Outcomes in the Presence of Unlabeled Data},
  author = {Fateme Nateghi Haredasht and Celine Vens},
  journal= {arXiv preprint arXiv:2210.13891},
  year   = {2022}
}