中文

利用混合数据平衡和反事实增强代谢综合征预测

机器学习 2026-03-10 v2 人工智能

摘要

代谢综合征(MetS)是一组相互关联的危险因素,显著增加心血管疾病和2型糖尿病的风险。尽管其全球流行,但由于类别不平衡、数据稀缺以及现有研究方法不一致等问题,MetS的准确预测仍然具有挑战性。在本文中,我们通过系统评估和优化用于MetS预测的机器学习(ML)模型,利用先进的数据平衡技术和反事实分析来解决这些挑战。在随机过采样(ROS)、SMOTE、ADASYN和CTGAN等各种数据平衡技术下,训练并比较了多种ML模型,包括XGBoost、随机森林、TabNet等。此外,我们引入了MetaBoost,一种新颖的混合框架,它集成了SMOTE、ADASYN和CTGAN,通过加权平均和迭代权重调整优化合成数据生成,以增强模型性能(与单一平衡技术相比,准确率提升高达1.87%)。进行了全面的反事实分析,以量化将个体从高风险类别转移到低风险类别所需的特征级变化。结果表明,血糖(50.3%)和甘油三酯(46.7%)是最常被修改的特征,突显了它们在降低MetS风险中的临床意义。此外,概率分析显示,血糖升高(85.5%可能性)和甘油三酯升高(74.9%后验概率)是最强的预测因子。这项研究不仅推进了MetS预测的方法严谨性,也为临床医生和研究人员提供了可操作的见解,突显了ML在减轻代谢综合征公共卫生负担方面的潜力。

关键词

引用

@article{arxiv.2504.06987,
  title  = {Enhancing Metabolic Syndrome Prediction with Hybrid Data Balancing and Counterfactuals},
  author = {Sanyam Paresh Shah and Abdullah Mamun and Shovito Barua Soumma and Hassan Ghasemzadeh},
  journal= {arXiv preprint arXiv:2504.06987},
  year   = {2026}
}

备注

Accepted at the IEEE EMBC 2025 Conference. 7 pages, 3 figures