中文

从数据提升到连续风险估计:面向临床路径预测监控的过程感知流水线

机器学习 2026-05-13 v2 软件工程

摘要

本文提出了一条可复现且过程感知的流水线,用于临床路径的预测监控。该方法集成了数据提升、时序重建、事件日志构建、基于前缀的表示以及预测建模,以支持对部分观测到的患者轨迹进行连续推理,从而克服了传统回顾性过程挖掘的局限性。该框架在 COVID-19 临床路径上进行了评估,以 ICU 入院作为预测目标,考虑了 4,479 个患者病例和 46,804 个前缀。预测模型使用病例级划分进行训练和评估,测试集中包含 896 名患者。Logistic Regression 取得了最佳性能(AUC 0.906,F1-score 0.835)。详细的基于前缀的分析表明,随着新的临床事件变得可用,预测性能逐步提升,AUC 从路径早期的 0.642 提升至后期的 0.942。结果突出了两个关键发现:预测信号沿临床路径逐步出现,且过程感知表示能够从不断演化的患者轨迹中实现有效的早期风险估计。总体而言,研究结果表明,医疗保健中的预测监控最好被设想为一个连续的、动态感知的过程,其中风险估计随着患者旅程的演化而被逐步细化。

关键词

引用

@article{arxiv.2605.03895,
  title  = {From Data Lifting to Continuous Risk Estimation: A Process-Aware Pipeline for Predictive Monitoring of Clinical Pathways},
  author = {Pasquale Ardimento and Mario Luca Bernardi and Marta Cimitile and Samuele Latorre},
  journal= {arXiv preprint arXiv:2605.03895},
  year   = {2026}
}