医学摘要中遗漏内容的外部聚焦评估
计算与语言
2024-11-13 v2 人工智能
摘要
大语言模型(LLMs)在医疗等安全关键应用中已展现潜力,但量化性能的能力仍滞后。此挑战的一个例子是评估患者的医疗记录摘要。所得摘要可使医生快速获得患者健康状况的高层概览。然而,遗漏患者记录重要事实的摘要会产生误导性画像,进而对医疗决策造成负面后果。我们提出 MED-OMIT 作为探索此挑战的度量。我们聚焦于利用医患病史对话生成主观记录(患者病史摘要)作为案例研究。我们首先从对话中离散化事实,并识别哪些被主观记录遗漏。为确定哪些事实具有临床相关性,我们度量每个事实对模拟鉴别诊断的重要性。我们将 MED-OMIT 的表现与临床专家比较,发现广泛一致。我们使用 MED-OMIT 评估 LLM 在主观记录生成上的表现,发现部分 LLM(gpt-4 与 llama-3.1-405b)几乎无需费力即可表现良好,而其他(如 Llama 2)表现较差。
引用
@article{arxiv.2311.08303,
title = {Extrinsically-Focused Evaluation of Omissions in Medical Summarization},
author = {Elliot Schumacher and Daniel Rosenthal and Dhruv Naik and Varun Nair and Luladay Price and Geoffrey Tso and Anitha Kannan},
journal= {arXiv preprint arXiv:2311.08303},
year = {2024}
}
备注
Accepted to ML4H 2024