中文

面向EHR数据的静态与动态随机森林模型比较:在存在竞争风险的情况下预测中心静脉血栓栓塞感染

地球与行星天体物理 2024-04-26 v1

摘要

与住院相关的预后结果通常不受censoring的影响,可以以分类或事件时间的方式进行建模。竞争事件很常见,但常被忽略。我们比较了随机森林(RF)模型的性能,用于预测中心静脉血栓栓塞感染(CLABSI)风险,使用不同的结果操作化方式。我们包括来自 Leuven大学医院27478次住院记录,其中包括30862次导管治疗(970例CLABSI、1466例死亡和28426例出院),用于构建针对二分类(CLABSI vs no CLABSI)、多分类(CLABSI、出院、死亡或无事件)、生存(CLABSI时间)和竞争风险(CLABSI时间、出院或死亡)结果的静态和动态RF模型,以预测7天CLABSI风险。我们在100个训练/测试分割中评估了模型性能。在二分类、多分类和竞争风险模型的性能相似:AUROC在基线预测时为0.74,在导管期第5天的预测提升至0.78,随后下降。生存模型高估了CLABSI风险(O:E比值在1.2至1.6之间),其AUROC约低于其他模型0.01。二分类和多分类模型计算时间最低。包括多个结果事件(多分类和竞争风险)的模型内部结构与二分类和生存模型不同。在缺乏censoring的情况下,复杂的建模选择不会在我们研究的环境中显著提高二分类模型相对于CLABSI预测的预测性能。生存模型应避免在竞争事件发生时进行censoring。

关键词

引用

@article{arxiv.2404.16126,
  title  = {Detectability of Surface Biosignatures for Directly-Imaged Rocky Exoplanets},
  author = {Schuyler R. Borges and Gabrielle G. Jones and Tyler D. Robinson},
  journal= {arXiv preprint arXiv:2404.16126},
  year   = {2024}
}

备注

in press; as-accepted version, prior to journal editing