CKD风险预测中的校准、不确定性沟通与部署就绪性:框架评估研究
机器学习
2026-05-22 v1
摘要
慢性肾病(CKD)风险预测的机器学习模型常在内部测试集上显示出强大的区分度,但校准和不确定性量化获得了很少的关注,导致临床医生无法获得可靠的概率输出信息。我们在UCI CKD数据集(400例患者,62.5% CKD患病率)上训练了五种分类器:逻辑回归、随机森林、XGBoost、使用Platt scaling的支持向量机和高斯朴素贝叶斯。我们评估了每个模型在校准质量、保 conformal覆盖率以及八标准部署就绪性框架方面的表现。对最佳校准变体应用分布式压力测试,将其应用于公开可用的MIMIC-IV示范队列(97例患者,23.7% CKD患病率),以评估其在患病率迁移和特征缺失情况下的行为。我们使用预期校准误差(ECE)和Brier分数,在Platt scaling和isotonic回归之后衡量校准,并通过分层保 conformal预测量化不确定性,目标为90%的边际覆盖率。所有五个模型在UCI测试集上达到AUROC 1.00。Isotonic recalibration将内部ECE降低至0.000-0.022。在MIMIC-IV上,AUROC下降至0.48-0.58,ECE升至0.68-0.76,保 conformal覆盖率从0.80-0.98下降到0.21-0.25,远低于90%的目标。没有任何模型在部署就绪性检查表中得了16分以上的分数。接近完美的内部性能并未实现向实际部署的转移。在实际部署之前,应在外部数据上评估校准稳定性和保 conformal覆盖率。
引用
@article{arxiv.2605.21566,
title = {Calibration, Uncertainty Communication, and Deployment Readiness in CKD Risk Prediction: A Framework Evaluation Study},
author = {Michael O. Eniolade},
journal= {arXiv preprint arXiv:2605.21566},
year = {2026}
}
备注
27 pages, 6 figures, 4 tables. Supplementary materials (S1-S4) included as ancillary file