通过混合机器学习模型实现可泛化的糖尿病风险分层
机器学习
2025-09-26 v1
摘要
背景/目的:糖尿病影响全球超过5.37亿人,预计到2045年将达到7.83亿。早期风险分层可受益于机器学习。我们比较了两种混合分类器,并评估它们在外部队列上的泛化能力。方法:构建了两种混合模型:(i) XGBoost + 随机森林 (XGB-RF) 和 (ii) 支持向量机 + 逻辑回归 (SVM-LR)。一个防泄漏的标准化流水线(编码、插补、min-max缩放;仅在训练折上使用SMOTE;SVM的概率校准)在主要数据集上拟合并冻结。评估优先考虑与阈值无关的判别能力(AUROC/AUPRC)和校准度(Brier分数、斜率/截距)。外部验证使用PIMA队列(N=768),采用冻结流水线;PIMA上任何阈值相关指标均在默认规则τ=0.5下计算。结果:在主要数据集上(PR基线=0.50),XGB-RF达到AUROC约0.995和AUPRC约0.998,优于SVM-LR(AUROC约0.978;AUPRC约0.947)。在PIMA上(PR基线约0.349),XGB-RF保持了强劲性能(AUROC约0.990;AUPRC约0.959);SVM-LR较低(AUROC约0.963;AUPRC约0.875)。在τ=0.5下PIMA上的阈值相关指标为XGB-RF(准确率0.960;精确率0.941;召回率0.944;F1 0.942)和SVM-LR(准确率0.900;精确率0.855;召回率0.858;F1 0.857)。结论:在内部和外部队列中,XGB-RF始终优于SVM-LR,并在ROC/PR上表现出较小的外部衰减,校准度可接受。这些结果支持基于梯度提升的混合方法作为糖尿病风险分层的鲁棒、可迁移方法,并激励在部署时基于临床权衡进行阈值选择的前瞻性、多站点验证。
引用
@article{arxiv.2509.20565,
title = {Generalizable Diabetes Risk Stratification via Hybrid Machine Learning Models},
author = {Athar Parvez and Muhammad Jawad Mufti},
journal= {arXiv preprint arXiv:2509.20565},
year = {2025}
}