集成机器学习集成与大语言模型用于心脏病预测:基于投票融合
机器学习
2026-02-27 v1 人工智能
摘要
心血管疾病是全球死亡的主要原因,迫切需要早期识别、精确的风险分类和可靠的决策支持技术。大语言模型(LLM)的出现提供了新的零样本和少样本推理能力,尽管机器学习(ML)算法,特别是集成方法如 Random Forest、XGBoost、LightGBM 和 CatBoost,擅长建模复杂的非线性患者数据,常常优于 logistic 回归。本研究使用 1190 条患者记录的合并数据集,比较传统机器学习模型(准确率 95.78%,ROC-AUC 0.96)与通过 OpenRouter API 调用的开源大语言模型。最终,结合 ML 集成与 LLM 推理的混合融合(以 Gemini 2.5 Flash 为例)取得最佳结果(准确率 96.62%,AUC 0.97),表明 LLM(78.9% 准确率)最佳效果是与 ML 模型结合而非单独使用。结果显示,ML 集成实现了最高性能(95.78% 准确率,ROC-AUC 0.96),而 LLM 在零样本(78.9%)和少样本(72.6%)场景下表现适中。该混合方法增强了在不确定情况下的强度,说明集成 ML 在结构化表格预测中为最佳案例,但可以与混合 ML-LLM 系统集成,以提供微小的提升并为更可靠的临床决策支持工具铺路。
引用
@article{arxiv.2602.22280,
title = {Integrating Machine Learning Ensembles and Large Language Models for Heart Disease Prediction Using Voting Fusion},
author = {Md. Tahsin Amin and Tanim Ahmmod and Zannatul Ferdus and Talukder Naemul Hasan Naem and Ehsanul Ferdous and Arpita Bhattacharjee and Ishmam Ahmed Solaiman and Nahiyan Bin Noor},
journal= {arXiv preprint arXiv:2602.22280},
year = {2026}
}
备注
7 pages, 8 figures, (Accepted at a peer-reviewed conference)