面向重症医学病房的大语言模型基准测试
人工智能
2025-12-24 v1
摘要
随着大语言模型(LLMs)的出现,自然语言处理领域的各类任务都得到了变革。然而,其在预测类任务中的应用仍缺乏深入研究。本研究对比了包括在临床数据上训练的 GatorTron-Base、Llama 8B 和 Mistral 7B 等大型语言模型,以及 BioBERT、DocBERT、BioClinicalBERT、Word2Vec 和 Doc2Vec 等模型,为预测重症患者中血压下垂(Shock)设定基准。及时预测血压下垂可使及时干预,从而改善患者预后。从 MIMIC III 数据库中 17,294 例 ICU 住院记录中,对住院时间 > 24 小时和血压指数(SI)> 0.7 的病例进行评分,分别得到 355 例正常 SI 指数和 87 例异常 SI 指数的患者。在微调过程中采用 Focal Loss 和交叉熵损失以解决类别不平衡问题。我们的发现表明,虽然 GatorTron Base 实现了最高的加权召回率为 80.5%,但 SLMs 和 LLMs 的整体性能指标相当。这表明尽管 LLMs 在文本类任务中表现出色,但在预测未来临床事件方面并不一定优于 SLMs。为实现有意义的临床成果,未来的工作应优先发展能够预测临床病程轨迹的模型,而不是聚焦于命名实体识别或表型分型等更简单的任务。
引用
@article{arxiv.2512.20520,
title = {Benchmarking LLMs for Predictive Applications in the Intensive Care Units},
author = {Chehak Malhotra and Mehak Gopal and Akshaya Devadiga and Pradeep Singh and Ridam Pal and Ritwik Kashyap and Tavpritesh Sethi},
journal= {arXiv preprint arXiv:2512.20520},
year = {2025}
}