中文

一种基于 SHAP 的可解释多层堆叠集成学习方法用于预测急性卒中住院时长

机器学习 2025-06-17 v2

摘要

急性卒中住院时长(LOS)预测对于改善医疗护理规划至关重要。现有的机器学习模型表现出预测性能欠佳、泛化能力有限,且忽视了系统层面的因素。我们旨在通过优化预测变量并开发一个可解释的多层堆叠集成模型,来提升模型的效率、性能和可解释性。数据来自澳大利亚两年一度的卒中基金会急性审计(2015、2017、2019、2021)。针对缺血性和出血性卒中分别构建模型。结局指标为延长 LOS(LOS 高于第 75 百分位数)。候选预测变量(缺血性:n=89;出血性:n=83)被分为患者、临床和系统三个领域。使用基于相关性的方法进行特征选择,以优化关键预测变量。模型评估包括判别力(AUC)、校准曲线和可解释性(SHAP 图)。在缺血性卒中中(N=12,575),延长 LOS 为 >=9 天,而在出血性卒中中(N=1,970)为 >=11 天。对于缺血性卒中,集成模型取得了更优的性能 [AUC: 0.824 (95% CI: 0.801-0.846)],且在统计学上显著优于逻辑回归 [AUC: 0.805 (95% CI: 0.782-0.829); P=0.0004]。然而,对于出血性卒中,该模型 [AUC: 0.843 (95% CI: 0.790-0.895)] 在统计学上并未优于逻辑回归 [AUC: 0.828 (95% CI: 0.774-0.882); P=0.136]。SHAP 分析识别了两种类型卒中共有的预测变量:康复评估、尿失禁、卒中单元护理、无法独立行走、物理治疗以及卒中护理协调员的参与。可解释的集成模型有效预测了缺血性卒中的延长 LOS。对于出血性卒中,需要在更大的队列中进行进一步验证。

关键词

引用

@article{arxiv.2505.24101,
  title  = {A SHAP-based explainable multi-level stacking ensemble learning method for predicting the length of stay in acute stroke},
  author = {Zhenran Xu},
  journal= {arXiv preprint arXiv:2505.24101},
  year   = {2025}
}

备注

This master thesis paper withdrawn for further revision and to obtain approval from all co-authors for public release