中文

DistillNote:面向LLM生成的临床笔记摘要的功能性评估框架

计算与语言 2026-02-20 v2

摘要

大型语言模型(LLM)越来越多地被用于从临床笔记中生成摘要。然而,它们保留基本诊断信息的能力仍未得到充分探索,这可能会给患者护理带来严重风险。本研究引入了DistillNote,一个针对LLM摘要的评估框架,该框架通过将生成的摘要下游应用于一个复杂的临床预测任务,明确量化保留了多少预测信号,从而针对其功能效用进行评估。我们从MIMIC-IV临床笔记中生成了超过192,000个LLM摘要,压缩率递增:标准、分节和蒸馏分节。选择心力衰竭诊断作为预测任务,因为它需要整合广泛的临床信号。LLM在原始笔记及其摘要上进行了微调,并使用AUROC指标比较了它们的诊断性能。我们将DistillNote的结果与LLM-as-judge和临床医生的评估进行了对比,评估了不同评估方法之间的一致性。尽管进行了大幅压缩,LLM生成的摘要仍保持了较强的心力衰竭诊断信号。在最紧凑的摘要(约缩小20倍)上训练的模型达到了0.92的AUROC,而原始笔记基线为0.94(保留了97%)。功能评估为医学摘要评估提供了新的视角,强调临床效用是质量的关键维度。DistillNote引入了一种新的、可扩展的、基于任务的方法来评估LLM生成的临床摘要的功能效用。我们的结果首次详细描述了LLM临床摘要的压缩与性能权衡。该框架设计为可适应其他预测任务和临床领域,有助于在现实医疗环境中部署LLM摘要器时做出数据驱动的决策。

关键词

引用

@article{arxiv.2506.16777,
  title  = {DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries},
  author = {Heloisa Oss Boll and Antonio Oss Boll and Leticia Puttlitz Boll and Ameen Abu Hanna and Iacer Calixto},
  journal= {arXiv preprint arXiv:2506.16777},
  year   = {2026}
}