面向医院病程摘要的适配大语言模型数据集与基准
计算与语言
2025-04-24 v5 人工智能
机器学习
摘要
简明医院病程(BHC)摘要是概括患者住院期间情况的临床文档。尽管大语言模型(LLMs)在自动化实际任务中展现出卓越能力,但其在医疗保健应用中的能力,例如从临床笔记中合成 BHC,尚未得到证实。我们引入了一个新颖的预处理数据集 MIMIC-IV-BHC,该数据集包含临床笔记和简明医院病程(BHC)对,以适配 LLMs 进行 BHC 合成。此外,我们引入了一个针对两个通用 LLMs 和三个医疗适配 LLMs 的摘要性能基准。以临床笔记作为输入,我们将基于提示(使用上下文学习)和基于微调的适配策略应用于三个开源 LLMs(Clinical-T5-Large、Llama2-13B、FLAN-UL2)和两个专有 LLMs(GPT-3.5、GPT-4)。我们使用自然语言相似度指标在多种上下文长度输入下评估了这些 LLMs。我们进一步开展了一项涉及五名临床医生的临床研究,在 30 个样本上比较了临床医生撰写和 LLM 生成的 BHCs,重点关注它们通过提高摘要质量来增强临床决策的潜力。我们观察到,在 BLEU 和 BERT-Score 的定量评估指标下,微调的 Llama2-13B LLM 优于其他领域适配模型。与微调的 Llama2-13B 相比,采用上下文学习的 GPT-4 对临床笔记输入上下文长度的增加表现出更强的鲁棒性。尽管定量指标相当,读者研究表明,与微调的 Llama2-13B 摘要和原始摘要相比,对采用上下文学习的 GPT-4 生成的摘要存在显著偏好,凸显了定性临床评估的必要性。
引用
@article{arxiv.2403.05720,
title = {A dataset and benchmark for hospital course summarization with adapted large language models},
author = {Asad Aali and Dave Van Veen and Yamin Ishraq Arefeen and Jason Hom and Christian Bluethgen and Eduardo Pontes Reis and Sergios Gatidis and Namuun Clifford and Joseph Daws and Arash S. Tehrani and Jangwon Kim and Akshay S. Chaudhari},
journal= {arXiv preprint arXiv:2403.05720},
year = {2025}
}