大语言模型与经典机器学习在高维表格数据新冠死亡率预测中的表现比较
摘要
本研究比较了经典特征型机器学习模型(CMLs)和大语言模型(LLMs)在使用来自四家医院的 9,134 名患者高维表格数据预测新冠死亡率时的性能。评估了七种 CML 模型,包括 XGBoost 和随机森林(RF),以及八种 LLMs,如 GPT-4 和 Mistral-7b,这些模型在文本转换后的结构化数据上执行零样本分类。此外,对 Mistral-7b 采用 QLoRA 方法进行微调。XGBoost 和 RF 在 CMLs 中表现优异,分别在内部和外部验证中获得 F1 分数为 0.87 和 0.83。GPT-4 在 LLM 类别中领先,F1 分数为 0.43,而微调 Mistral-7b 将其召回率从 1% 提升至 79%,在外部验证中获得稳定的 F1 分数 0.74。虽然 LLMs 在零样本分类中表现中等,但微调显著提升了其效果, potentially 弥合了与 CML 模型之间的差距。然而,CMLs 在处理高维表格数据任务方面仍优于 LLMs。本研究突显了 CMLs 和微调后 LLMs 在医学预测建模中的潜力,同时强调了 CMLs 在结构化数据分析中的当前优势。
引用
@article{arxiv.2409.02136,
title = {Large Language Models versus Classical Machine Learning: Performance in COVID-19 Mortality Prediction Using High-Dimensional Tabular Data},
author = {Mohammadreza Ghaffarzadeh-Esfahani and Mahdi Ghaffarzadeh-Esfahani and Arian Salahi-Niri and Hossein Toreyhi and Zahra Atf and Amirali Mohsenzadeh-Kermani and Mahshad Sarikhani and Zohreh Tajabadi and Fatemeh Shojaeian and Mohammad Hassan Bagheri and Aydin Feyzi and Mohammadamin Tarighatpayma and Narges Gazmeh and Fateme Heydari and Hossein Afshar and Amirreza Allahgholipour and Farid Alimardani and Ameneh Salehi and Naghmeh Asadimanesh and Mohammad Amin Khalafi and Hadis Shabanipour and Ali Moradi and Sajjad Hossein Zadeh and Omid Yazdani and Romina Esbati and Moozhan Maleki and Danial Samiei Nasr and Amirali Soheili and Hossein Majlesi and Saba Shahsavan and Alireza Soheilipour and Nooshin Goudarzi and Erfan Taherifard and Hamidreza Hatamabadi and Jamil S Samaan and Thomas Savage and Ankit Sakhuja and Ali Soroush and Girish Nadkarni and Ilad Alavi Darazam and Mohamad Amin Pourhoseingholi and Seyed Amir Ahmad Safavi-Naini},
journal= {arXiv preprint arXiv:2409.02136},
year = {2026}
}
备注
Code is available at: https://github.com/mohammad-gh009/Large-Language-Models-vs-Classical-Machine-learning and https://github.com/Sdamirsa/Tehran_COVID_Cohort. The datasets are available from the corresponding author on reasonable request ([email protected])