ClinicRealm:重新评估大型语言模型在非生成性临床预测任务中的表现
计算与语言
2025-10-07 v3 人工智能
机器学习
摘要
大型语言模型(LLM)正在医疗领域广泛部署。然而,其在非生成性临床预测中的实际效用——常被认为低于专用模型——仍缺乏系统评估,导致领域内持续争论,并可能因缺乏规范性基准测试而引发误用、误解或过度依赖。我们的ClinicRealm研究通过对15个GPT系列LLM、5个BERT系列模型和11种传统方法进行基准测试,评估其在非结构化临床笔记和结构化电子健康记录(EHR)上的表现,同时考察其推理能力、可靠性和公平性。关键发现表明:在临床笔记预测任务中,领先的LLM(如DeepSeek-V3.1-Think、GPT-5)在零样本设置下已显著超越微调后的BERT模型。在结构化EHR上,虽然数据充足时专用模型优势明显,但高级LLM(如GPT-5、DeepSeek-V3.1-Think)在数据稀缺场景展现出强大的零样本能力,常超越传统模型。值得注意的是,领先的开源LLM可与或超越专有模型。这些结果为LLM在非生成性临床预测中的竞争力提供了有力证据,尤其在处理非结构化文本方面,且对数据稀缺的结构化数据提供了高效选项,因而需要重新评估模型选择策略。这一研究应为医学信息学家、AI开发者和临床研究者提供重要洞见,可能促使对当前假设的重新审视,并激发LLM在预测性医疗保健中新应用的想象力。
引用
@article{arxiv.2407.18525,
title = {ClinicRealm: Re-evaluating Large Language Models with Conventional Machine Learning for Non-Generative Clinical Prediction Tasks},
author = {Yinghao Zhu and Junyi Gao and Zixiang Wang and Weibin Liao and Xiaochen Zheng and Lifang Liang and Miguel O. Bernabeu and Yasha Wang and Lequan Yu and Chengwei Pan and Ewen M. Harrison and Liantao Ma},
journal= {arXiv preprint arXiv:2407.18525},
year = {2025}
}
备注
Code: https://github.com/yhzhu99/ehr-llm-benchmark