利用大语言模型从临床病例报告中重建脓毒症轨迹:脓毒症文本时间序列语料库
计算与语言
2026-05-13 v3 人工智能
机器学习
摘要
临床病例报告和出院小结可能是对患者诊疗过程最完整、最准确的总结,但它们是在诊疗结束后定稿的,即带有事后时间戳。补充的结构化数据流虽然可用得更早,但存在不完整的问题。为了在更完整且时间粒度更细的数据上训练模型和算法,我们构建了一个流水线,利用大语言模型对病例报告中的时间定位发现进行表型分析、提取和标注。我们应用该流水线生成了一个开放获取的脓毒症(Sepsis-3)文本时间序列语料库,包含来自 PubMed-Open Access (PMOA) 子集的 2,139 份病例报告。为验证我们的系统,我们将其应用于 PMOA 以及来自 i2b2/MIMIC-IV 的时间线标注,并将结果与医师专家的标注进行比较。我们展示了临床发现的高恢复率(事件匹配率:GPT-5--0.93,Llama 3.3 70B Instruct--0.76)和强时间排序能力(一致性:GPT-5--0.965,Llama 3.3 70B Instruct--0.908)。我们的工作刻画了 LLM 在文本中对临床发现进行时间定位的能力,说明了 LLM 用于时间重建的局限性,并提供了通过多模态集成进行改进的几种潜在途径。
引用
@article{arxiv.2504.12326,
title = {Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis},
author = {Shahriar Noroozizadeh and Jeremy C. Weiss},
journal= {arXiv preprint arXiv:2504.12326},
year = {2026}
}
备注
Conference on Health, Inference, and Learning (CHIL 2026)