从聊天到体检:大型语言模型能否在糖尿病预测中发挥作用?
计算与语言
2025-06-19 v1
摘要
尽管机器学习(ML)和深度学习(DL)模型在糖尿病预测中被广泛应用,但大型语言模型(LLMs)用于结构化数值数据的应用仍鲜有探索。本研究测试了LLMs在零-shot、一-shot和三-shot提示方法下进行糖尿病预测的有效性。我们采用帕IMA印度糖尿病数据库(PIDD)进行实证分析。我们评估了六种LLMs,包括四个开源模型:Gemma-2-27B、Mistral-7B、Llama-3.1-8B和Llama-3.2-2B,以及两款专有模型:GPT-4o和Gemini Flash 2.0。此外,我们将其性能与三种传统机器学习模型进行比较:随机森林、逻辑回归和支持向量机(SVM)。我们使用准确率、精确率、召回率和F1分数作为评估指标。我们的结果显示,专有LLMs的性能优于开源模型,在少数样本设置下GPT-4o和Gemma-2-27B实现了最高的准确率。值得注意的是,Gemma-2-27B在F1分数方面也超过了传统机器学习模型。然而,仍存在诸多问题,如不同提示策略下的性能波动,以及需要领域特定微调的不足。这一研究表明,LLMs可用于医疗预测任务,鼓励未来在提示工程和混合方法方面工作,以提高医疗预测的效果。
引用
@article{arxiv.2506.14949,
title = {From Chat to Checkup: Can Large Language Models Assist in Diabetes Prediction?},
author = {Shadman Sakib and Oishy Fatema Akhand and Ajwad Abrar},
journal= {arXiv preprint arXiv:2506.14949},
year = {2025}
}
备注
Accepted in 1st IEEE QPAIN 2025