中文

利用结构化纵向电子健康记录数据提示大语言模型进行零样本临床预测

计算与语言 2024-02-13 v2 人工智能 机器学习

摘要

结构化纵向电子健康记录(EHR)数据固有的复杂性,当与传统上为自然语言处理量身定制的大语言模型(LLM)集成时,构成了重大挑战。受新疾病爆发期间快速决策需求的驱动(传统预测模型由于缺乏历史数据而常常失败),本研究调查了LLM(如GPT-4)对EHR数据的适应性。我们特别关注它们的零样本能力,这使它们能够在未经过明确训练的场景中进行预测。针对EHR数据的纵向性、稀疏性和知识密集型特性,我们的提示方法涉及考虑特定的EHR特征(如单位和参考范围),并采用与临床背景一致的情境学习策略。我们在MIMIC-IV和TJH数据集上的全面实验表明,通过我们精心设计的提示框架,LLM可以在关键任务(如死亡率、住院时长和30天再入院)上将预测性能提高约35%,在少样本设置中超越机器学习模型。我们的研究强调了LLM在增强临床决策方面的潜力,特别是在紧急医疗情况(如没有标注数据的新发疾病爆发)中。代码可在https://github.com/yhzhu99/llm4healthcare公开获取,以促进可重复性。

关键词

引用

@article{arxiv.2402.01713,
  title  = {Prompting Large Language Models for Zero-Shot Clinical Prediction with Structured Longitudinal Electronic Health Record Data},
  author = {Yinghao Zhu and Zixiang Wang and Junyi Gao and Yuning Tong and Jingkun An and Weibin Liao and Ewen M. Harrison and Liantao Ma and Chengwei Pan},
  journal= {arXiv preprint arXiv:2402.01713},
  year   = {2024}
}