ClinicalBench:大型语言模型能在临床预测中击败传统机器学习模型吗?
计算与语言
2024-11-12 v1
摘要
大型语言模型(LLMs)凭借其在医学文本处理和医学资格考试方面的卓越能力,有望彻底改变当前的临床系统。与此同时,SVM和XGBoost等传统机器学习模型仍主要应用于临床预测任务。一个新兴的问题是:大型语言模型能在临床预测中击败传统机器学习模型吗?因此,我们构建了一个新的基准ClinicalBench,以全面研究通用型和医学大型语言模型的临床预测建模能力,并将其与传统机器学习模型进行比较。ClinicalBench涵盖了三种常见的临床预测任务、两个数据库、14个通用型大型语言模型、8个医学大型语言模型和11个传统机器学习模型。通过广泛的实证研究,我们发现无论是通用型还是医学大型语言模型,即使在不同模型规模、多样化提示或微调策略下,仍然无法在临床预测中击败传统机器学习模型,这揭示了它们在临床推理和决策方面可能存在的不足。我们呼吁从业者在临床应用中采用大型语言模型时保持谨慎。ClinicalBench可用于弥合大型语言模型在医疗领域的发展与真实临床实践之间的差距。
引用
@article{arxiv.2411.06469,
title = {ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?},
author = {Canyu Chen and Jian Yu and Shan Chen and Che Liu and Zhongwei Wan and Danielle Bitterman and Fei Wang and Kai Shu},
journal= {arXiv preprint arXiv:2411.06469},
year = {2024}
}
备注
The first two authors contributed equally. 10 pages for main paper, 66 pages including appendix. Project website: https://clinicalbench.github.io