基于罗马尼亚电子健康记录数据的可解释机器学习用于败血症死亡率预测
机器学习
2026-04-07 v1 计算机视觉与模式识别
摘要
我们开发并分析了用于败血症死亡率预测的可解释机器学习(ML)模型,采用来自罗马尼亚大型急诊医院的 12,286 例住院病例的新型电子健康记录(EHR)数据集。该数据集包含人口学信息、国际疾病分类(ICD-10)诊断以及 600 种类型实验室检测项目。本研究旨在识别临床强预测因子,同时在三个分类任务中实现最先进成绩:(1)死亡 vs. 出院、(2)死亡 vs. 恢复、(3)恢复 vs. 改善。我们训练了五个 ML 模型,以捕捉复杂分布同时保持临床可解释性。实验探讨了特征丰富性与患者覆盖率之间的权衡,使用 10~50 个最常见实验室检测项目的子集。模型性能采用准确率和受试者工作曲线下面积(AUC)进行评估,可解释性通过 SHapley 加法解释(SHAP)进行评估。最高性能出现在死亡 vs. 恢复案例研究中(AUC=0.983,准确率=0.93)。SHAP 分析识别出若干强预测因子,包括心血管共病、尿素水平、谷丙转氨酶、血小板计数以及嗜中性粒细胞百分比。嗜好中化(eosinopenia)作为顶级预测因子浮现,凸显其作为当前评估标准中未被包含的价值,而高性能表明这些模型在临床应用中的可行性。
引用
@article{arxiv.2604.04698,
title = {Explainable Machine Learning for Sepsis Outcome Prediction Using a Novel Romanian Electronic Health Record Dataset},
author = {Andrei-Alexandru Bunea and Ovidiu Ghibea and Dan-Matei Popovici and Ion Daniel and Octavian Andronic},
journal= {arXiv preprint arXiv:2604.04698},
year = {2026}
}