通过新型混合架构与特征选择协同推进表格数据脑卒中建模
定量方法
2026-05-22 v1 机器学习
应用统计
摘要
脑卒中仍然是全球死亡和残疾的主要原因之一,然而大多数表格数据预测模型的准确率仍徘徊在 95% 的阈值以下,限制了其实际应用。为弥补这一差距,本工作开发并验证了一个完全数据驱动且可解释的机器学习框架,旨在使用从包含 4,981 条记录的公开队列中获取的十个人口统计、生活方式和临床常规变量来预测脑卒中。我们采用详细的探索性数据分析(EDA)来理解数据集的结构和分布,随后进行严格的数据预处理,包括处理缺失值、异常值移除以及使用合成少数类过采样技术(SMOTE)进行类别不平衡校正。为了精简特征选择,我们使用了点双列相关和随机森林基尼重要性,并利用分层五折交叉验证优化了十种不同的算法——包括树集成、提升、核方法和多层神经网络。基于这些算法的概率预测,我们构建了所提出的模型,该模型包含随机森林、XGBoost、LightGBM 和支持向量分类器,并以逻辑回归作为元学习器。所提模型达到了 97.2% 的准确率和 97.15% 的 F1 分数,相较于表现最佳的单个模型 LightGBM(准确率为 91.4%)有显著提升。我们的研究结果表明,严格的预处理与多样化的混合模型相结合,可以将低成本的表格数据转化为近乎临床级的脑卒中风险评估工具。
引用
@article{arxiv.2505.15844,
title = {Advancing Tabular Stroke Modelling Through a Novel Hybrid Architecture and Feature-Selection Synergy},
author = {Yousuf Islam and Md. Jalal Uddin Chowdhury and Sumon Chandra Das},
journal= {arXiv preprint arXiv:2505.15844},
year = {2026}
}