中文

利用大语言模型从临床笔记中预测未知诊断

计算与语言 2025-03-31 v1

摘要

电子健康记录(EHR)中的药物与诊断之间常常缺乏明确的关联,这给临床决策和研究带来了困难。即便存在关联,诊断列表也可能不完整,尤其是在患者就诊初期。出院小结往往包含更完整的信息,有助于推断准确的诊断,尤其是在大语言模型(LLM)的辅助下。本研究探讨了大语言模型能否从临床笔记中预测隐含提及的诊断,并将其与相应药物进行关联。我们提出两个研究问题:(1) 在诊断预测任务中,跨多种大语言模型配置的多数投票是否优于最佳单一配置?(2) 多数投票的准确性对大语言模型超参数(如温度、top-p 和摘要长度)的敏感程度如何?为进行评估,我们从 20 份 MIMIC-IV 笔记中构建了一个由专家标注的、包含 240 对药物-诊断关系的新数据集。使用 GPT-3.5 Turbo,我们在短摘要与长摘要条件下运行了 18 种提示配置,共生成 8568 个测试用例。结果显示,多数投票达到了 75% 的准确率,优于最佳单一配置的 66%。没有任何单一超参数设置占据主导地位,但将确定性、平衡性与探索性策略相结合能够提升性能。较短的摘要通常带来更高的准确率。总之,采用多样化大语言模型配置进行集成式的多数投票能够提升 EHR 中的诊断预测效果,并为在临床文本中关联药物与诊断提供了一种有前景的方法。

关键词

引用

@article{arxiv.2503.22092,
  title  = {Leveraging LLMs for Predicting Unknown Diagnoses from Clinical Notes},
  author = {Dina Albassam and Adam Cross and Chengxiang Zhai},
  journal= {arXiv preprint arXiv:2503.22092},
  year   = {2025}
}

备注

19 pages, 3 figures, 5 tables