SPEER:基于内嵌实体检索的长临床摘要句子级规划
计算与语言
2024-09-30 v2
摘要
每次患者出院时,临床医生必须撰写一份长篇摘要。由于入院期间涵盖的大量独特临床概念,这项任务非常耗时。识别并覆盖显著实体对于摘要的临床实用性至关重要。我们在该任务上微调开源 LLM(Mistral-7B-Instruct 和 Zephyr-7B-beta),发现它们生成的摘要不完整且不忠实。为了增加实体覆盖率,我们训练了一个更小的、仅编码器模型来预测显著实体,这些实体被视为内容规划以指导 LLM。为了鼓励 LLM 关注源记录中的特定提及,我们提出了 SPEER:基于内嵌实体检索的句子级规划。具体而言,我们用特殊的 "{{ }}" 边界标记每个显著实体跨度,并指示 LLM 在生成每个句子之前检索标记的跨度。句子级规划作为一种状态跟踪形式,因为模型显式记录了它使用的实体。我们在约 167k 住院患者入院的大规模、多样化数据集上微调 Mistral 和 Zephyr 变体,并在 3 个数据集上进行评估。SPEER 在覆盖率和忠实度指标上均优于非引导和引导基线。
引用
@article{arxiv.2401.02369,
title = {SPEER: Sentence-Level Planning of Long Clinical Summaries via Embedded Entity Retrieval},
author = {Griffin Adams and Jason Zucker and Noémie Elhadad},
journal= {arXiv preprint arXiv:2401.02369},
year = {2024}
}
备注
COLM 2024